Skip to content

Repository files navigation

AgentRedline v1

English | 中文

量化每一层 AI 防御的真实贡献 —— 一个预注册、可复现、可审计的 Agent 防御控制归因基准。

AgentRedline 对 LLM Agent 批量执行注入攻击,在轨迹级测量每一层防御控制独立拦了多少、误报了多少——回答 Garak/PromptFoo 都不回答的问题。


为什么是它:差异化

工具 评估对象 回答的问题 盲区
Garak 单轮 prompt 响应 "这个模型会不会被注入?" 不评估多步 Agent 轨迹与防御层
PromptFoo 输出质量 "输出对不对?" 不评估攻击与防御
AgentRedline Agent 执行轨迹 + 防御层插桩 "每层防御各拦截多少、误报多少?" 无(专注防御归因)

核心发现(v1.0 基准,3072 runs)

对 5 项防御控制做完整析因(32 配置)消融,配对风险差 + Holm 校正:

控制 配对风险差 结论
RR(读取约束) −0.403 ✅ 承重墙(独立降险 40.3%)
AA(审批确认) −0.101 ✅ 显著(降险 10.1%)
IB / UF / CB ≈ 0 ❌ 无显著独立贡献
  • baseline(全关)违规率 51.0% → 全控制 0.0%(100% 阻断)
  • 结论经跨模型验证稳健(deepseek-v4-flash 与 qwen3:8b 下 RR 均为最强显著控制)
  • 防御贡献高度集中——你的防御投入该投在哪,数据说了算

3 分钟快速开始

# 1. 安装依赖(需要 ollama 本地模型)
git clone <repo> && cd AgentRedline
uv sync
ollama pull qwen3:8b

# 2. 跑一轮消融基准(双 SUT × 双孪生 × 24 案例 × 32 配置,断点续跑)
python scripts/run_benchmark_daemon.py   # 后台:Start-Process 方式

# 3. 出主效应报告 + 1.0 Capsule 封存 + 八项闸门
python scripts/finalize_v1.py

# 4. 查看结果
cat capsules/v1.0/report.md

本地零成本(电费 <5 元);换 GPU 机器全量约 1 天。

架构

CLI (redline validate/reproduce/gate)
   └─ 语料:24 案例 = 3 攻击目标 × 4 攻击家族 × 2 业务(attack/benign 双孪生)
   └─ 双 SUT:Native Tool Calling / LangGraph(独立实现,等价测试 E1–E10)
   └─ 五项控制 × 32 配置(IB/UF/RR/AA/CB 完整析因)
   └─ 防御层插桩:三 PEP(读/写/外发)+ 确定性 PDP(fail-closed)
   └─ 确定性 Oracle:合同 + 证据 → 阶段判定(LLM 永不作底层真值)
   └─ 证据链:账本哈希链 + OTel 语义事件 + 五锚根哈希 + 八查审计
   └─ 统计:配对风险差 + bootstrap CI + 配对置换检验 + Holm 校正
   └─ 封存:盲化 outcomes + control_assignment 分离 + Capsule checksums

方法论(可复现的根基)

  1. 预注册:实验前冻结假设族、案例注册表哈希、随机化种子(experiment.lock.yaml),防 p-hacking
  2. 盲化 Oracle:判定器不可见控制配置,结果与控制分配分离封存
  3. 证据链审计:账本/PEP/OTel/快照四源交叉 + 哈希链,篡改必检出
  4. 确定性判定:证据优先级 = 服务状态/账本 > PEP > PDP > OTel > LLM;证据缺失计 inconclusive,绝不默认安全
  5. 阶段分离:Dev / Pilot / Benchmark 三阶段,看结果不改指标

复现与审计

uv sync
uv run pytest                                   # 272 测试
uv run redline validate protocols/protocol-v1.0.0.yaml
python scripts/finalize_v1.py                    # 主效应 + 封存 + 闸门(可重复执行)

八项发布闸门(双 SUT 等价 / 控制一致性 / 24 案例完整 / 证据链 / 阶段分离 / 实例级效应 / Capsule 审计 / 开源完整)全过 → 1.0 reproducible benchmark

目录

packages/          core(执行/审计/闸门)· schemas(协议)· oracle(判定)· analysis(统计)
reference_lab/     金融夹具、24 案例注册表、双 SUT、五项控制插件
capsules/          v1.0(1.0 基准封存)· v1-benchmark(3072 runs)
protocols/         协议声明 v1.0.0
scripts/           基准执行器、守护驱动、收尾

许可

MIT

About

量化每一层 AI 防御的真实贡献 —— 预注册、可复现、可审计的 Agent 防御控制归因基准

Resources

Contributing

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages