Method
Clinical AI Calibration & Subgroup Stress-Test Planner
Which performance slices or calibration checks block clinical confidence?
Field scoring contract
| Field | Type | Role | Direction | Scored |
|---|---|---|---|---|
| Model and output | text | context | context | no |
| Calibration curves / Brier evidence | select | evidence_signal | higher_is_better | yes |
| Threshold justification | select | evidence_signal | higher_is_better | yes |
| Clinically relevant subgroup analysis | select | evidence_signal | higher_is_better | yes |
| External site / scanner shift analysis | select | evidence_signal | higher_is_better | yes |
| Harm and error-case review | select | evidence_signal | higher_is_better | yes |
| Drift monitoring triggers | select | evidence_signal | higher_is_better | yes |
Limits
- Preliminary output
- Human review required
- Not certification
- Context text is not averaged into numeric scores.
- Outputs require source/evidence review before decisions.