Red-Team Evaluation Flow
Adversarial-prompt generation, evaluation and remediation loop.
Rendering…
Make it your own.
flowchart LR
Scope[Scope: harms + threat models] --> Plan[Plan attacks + personas]
Plan --> Gen["Generate adversarial prompts<br/>(human + LLM-assisted)"]
Gen --> Run[Run against model]
Run --> Eval[Score: harmful / refused / safe-complete]
Eval --> Triage{Severity}
Triage -- low --> Backlog
Triage -- high --> Mitig[Mitigation:\nfilter / fine-tune / sys prompt]
Mitig --> Reg[Regression eval set]
Reg --> Run
Eval --> Report[Report:\nrisks + examples + mitigations]