MonitoringBench:面向智能体监控的半自动化红队测试
密码学与安全
2026-05-12 v1 人工智能
摘要
我们引入了一种红队测试方法,该方法能暴露出更难被捕获的针对编码智能体监控器的攻击,表明当前实践可能低估了攻击的诱发并高估了监控器的性能。我们指出了当前红队测试的三个挑战。第一,攻击生成中的模式坍缩,我们通过一种新颖的攻击分类法来扩大覆盖范围以减少该现象。第二,构想-执行差距:前沿 LLM 能够提出强有力的攻击想法或执行它们,但无法同时兼顾。我们通过将攻击构建分解为策略生成、执行和事后轨迹优化来缓解这一问题。第三,人工诱发成本高昂且难以扩展,我们通过半自动化红队测试流水线来解决这一问题。将该流水线应用于 BashArena(一个面向使用工具的编码智能体的 AI 控制场景),生成了 MonitoringBench,这是一个包含 2,644 条攻击轨迹的基准,用于评估监控器的能力与失败模式。我们的流水线产生了更多样且更强的攻击:Opus-4.5 监控器在仅诱发的 Opus 攻击上的捕获率为 94.9%,而在我们最佳优化攻击下降至 60.3%,多个中端监控器的下降幅度更大。针对三个开发监控器优化的攻击可泛化至十个留出监控器,且捕获率通常随监控器能力的提升而增加。利用该基准,我们提供了当前监控器能力的快照,并发现前沿监控器通常能检测到可疑行为,但会被说服所欺骗或无法适当校准可疑度评分,这表明了切实可行的改进路径。MonitoringBench 既为当前工具使用监控器提供了静态基准,也提供了一种可复用的方法,以便随着智能体和监控器的进步不断更新这些评估。
引用
@article{arxiv.2605.09684,
title = {MonitoringBench: Semi-Automated Red-Teaming for Agent Monitoring},
author = {Monika Jotautaitė and Maria Angelica Martinez and Ollie Matthews and Tyler Tracy},
journal= {arXiv preprint arXiv:2605.09684},
year = {2026}
}