Method

Prompt/RAG Adversarial Evaluation Harness

Can prompt/RAG controls withstand adversarial examples?

Field scoring contract

FieldTypeRoleDirectionScored
Scenariotextareacontextcontextno
Adversarial test setselectmitigation_evidencehigher_is_betteryes
Source isolation controlsselectmitigation_evidencehigher_is_betteryes
Tool policy controlsselectmitigation_evidencehigher_is_betteryes
Automated/human scorersselectmitigation_evidencehigher_is_betteryes
Replay logsselectmitigation_evidencehigher_is_betteryes
Downstream action riskselectrisk_driverhigher_is_worseyes

Limits