Method
Frontier AI Evaluation Planner
Plans capability, safety, robustness and deployment evaluations for frontier or agentic AI systems.
Field scoring contract
| Field | Type | Role | Direction | Scored |
|---|---|---|---|---|
| Capability benchmark plan | select | evidence_signal | higher_is_better | yes |
| Robustness tests | select | evidence_signal | higher_is_better | yes |
| Misuse/safety tests | select | evidence_signal | higher_is_better | yes |
| Tool-use/agent tests | select | evidence_signal | higher_is_better | yes |
| Monitoring plan | select | evidence_signal | higher_is_better | yes |
| Baselines and ablations | select | evidence_signal | higher_is_better | yes |
Limits
- Preliminary output
- Human review required
- Not certification
- Context text is not averaged into numeric scores.
- Outputs require source/evidence review before decisions.