Method
Prompt/RAG Adversarial Evaluation Harness
Can prompt/RAG controls withstand adversarial examples?
Field scoring contract
| Field | Type | Role | Direction | Scored |
|---|---|---|---|---|
| Scenario | textarea | context | context | no |
| Adversarial test set | select | mitigation_evidence | higher_is_better | yes |
| Source isolation controls | select | mitigation_evidence | higher_is_better | yes |
| Tool policy controls | select | mitigation_evidence | higher_is_better | yes |
| Automated/human scorers | select | mitigation_evidence | higher_is_better | yes |
| Replay logs | select | mitigation_evidence | higher_is_better | yes |
| Downstream action risk | select | risk_driver | higher_is_worse | yes |
Limits
- Preliminary output
- Human review required
- Not certification
- Context text is not averaged into numeric scores.
- Outputs require source/evidence review before decisions.