English | 中文
量化每一层 AI 防御的真实贡献 —— 一个预注册、可复现、可审计的 Agent 防御控制归因基准。
AgentRedline 对 LLM Agent 批量执行注入攻击,在轨迹级测量每一层防御控制独立拦了多少、误报了多少——回答 Garak/PromptFoo 都不回答的问题。
| 工具 | 评估对象 | 回答的问题 | 盲区 |
|---|---|---|---|
| Garak | 单轮 prompt 响应 | "这个模型会不会被注入?" | 不评估多步 Agent 轨迹与防御层 |
| PromptFoo | 输出质量 | "输出对不对?" | 不评估攻击与防御 |
| AgentRedline | Agent 执行轨迹 + 防御层插桩 | "每层防御各拦截多少、误报多少?" | 无(专注防御归因) |
对 5 项防御控制做完整析因(32 配置)消融,配对风险差 + Holm 校正:
| 控制 | 配对风险差 | 结论 |
|---|---|---|
| RR(读取约束) | −0.403 | ✅ 承重墙(独立降险 40.3%) |
| AA(审批确认) | −0.101 | ✅ 显著(降险 10.1%) |
| IB / UF / CB | ≈ 0 | ❌ 无显著独立贡献 |
- baseline(全关)违规率 51.0% → 全控制 0.0%(100% 阻断)
- 结论经跨模型验证稳健(deepseek-v4-flash 与 qwen3:8b 下 RR 均为最强显著控制)
- 防御贡献高度集中——你的防御投入该投在哪,数据说了算
# 1. 安装依赖(需要 ollama 本地模型)
git clone <repo> && cd AgentRedline
uv sync
ollama pull qwen3:8b
# 2. 跑一轮消融基准(双 SUT × 双孪生 × 24 案例 × 32 配置,断点续跑)
python scripts/run_benchmark_daemon.py # 后台:Start-Process 方式
# 3. 出主效应报告 + 1.0 Capsule 封存 + 八项闸门
python scripts/finalize_v1.py
# 4. 查看结果
cat capsules/v1.0/report.md本地零成本(电费 <5 元);换 GPU 机器全量约 1 天。
CLI (redline validate/reproduce/gate)
└─ 语料:24 案例 = 3 攻击目标 × 4 攻击家族 × 2 业务(attack/benign 双孪生)
└─ 双 SUT:Native Tool Calling / LangGraph(独立实现,等价测试 E1–E10)
└─ 五项控制 × 32 配置(IB/UF/RR/AA/CB 完整析因)
└─ 防御层插桩:三 PEP(读/写/外发)+ 确定性 PDP(fail-closed)
└─ 确定性 Oracle:合同 + 证据 → 阶段判定(LLM 永不作底层真值)
└─ 证据链:账本哈希链 + OTel 语义事件 + 五锚根哈希 + 八查审计
└─ 统计:配对风险差 + bootstrap CI + 配对置换检验 + Holm 校正
└─ 封存:盲化 outcomes + control_assignment 分离 + Capsule checksums
- 预注册:实验前冻结假设族、案例注册表哈希、随机化种子(
experiment.lock.yaml),防 p-hacking - 盲化 Oracle:判定器不可见控制配置,结果与控制分配分离封存
- 证据链审计:账本/PEP/OTel/快照四源交叉 + 哈希链,篡改必检出
- 确定性判定:证据优先级 = 服务状态/账本 > PEP > PDP > OTel > LLM;证据缺失计 inconclusive,绝不默认安全
- 阶段分离:Dev / Pilot / Benchmark 三阶段,看结果不改指标
uv sync
uv run pytest # 272 测试
uv run redline validate protocols/protocol-v1.0.0.yaml
python scripts/finalize_v1.py # 主效应 + 封存 + 闸门(可重复执行)八项发布闸门(双 SUT 等价 / 控制一致性 / 24 案例完整 / 证据链 / 阶段分离 / 实例级效应 / Capsule 审计 / 开源完整)全过 → 1.0 reproducible benchmark。
packages/ core(执行/审计/闸门)· schemas(协议)· oracle(判定)· analysis(统计)
reference_lab/ 金融夹具、24 案例注册表、双 SUT、五项控制插件
capsules/ v1.0(1.0 基准封存)· v1-benchmark(3072 runs)
protocols/ 协议声明 v1.0.0
scripts/ 基准执行器、守护驱动、收尾
MIT