Method
Generative Clinical AI Evaluation Protocol
What evidence blocks use of a generative clinical AI system?
Field scoring contract
| Field | Type | Role | Direction | Scored |
|---|---|---|---|---|
| Use case | text | context | context | no |
| Representative gold-case set | select | evidence_signal | higher_is_better | yes |
| Factuality / hallucination checks | select | evidence_signal | higher_is_better | yes |
| Source/citation validation | select | evidence_signal | higher_is_better | yes |
| Clinical safety and escalation policy | select | evidence_signal | higher_is_better | yes |
| Bias and subgroup language review | select | evidence_signal | higher_is_better | yes |
| Human review before use | select | evidence_signal | higher_is_better | yes |
Limits
- Preliminary output
- Human review required
- Not certification
- Context text is not averaged into numeric scores.
- Outputs require source/evidence review before decisions.