Method
Frontier Agent Evaluation Runner / Export Contract
Is an AI evaluation plan executable and reproducible?
Field scoring contract
| Field | Type | Role | Direction | Scored |
|---|---|---|---|---|
| Evaluation scope | text | context | context | no |
| Datasets/test tasks | select | evidence_signal | higher_is_better | yes |
| Scorers/metrics | select | evidence_signal | higher_is_better | yes |
| Trace/log capture | select | evidence_signal | higher_is_better | yes |
| Baselines/comparators | select | evidence_signal | higher_is_better | yes |
| Replay and determinism controls | select | evidence_signal | higher_is_better | yes |
| JSON export schema | select | evidence_signal | higher_is_better | yes |
Limits
- Preliminary output
- Human review required
- Not certification
- Context text is not averaged into numeric scores.
- Outputs require source/evidence review before decisions.