中文

LLM 代理的可靠弱到强监控

人工智能 2025-08-28 v1 密码学与安全 机器学习

摘要

我们对检测自主 LLM 代理(例如秘密共享私人信息)的监控系统进行压力测试。为此,我们系统化了监控红队 (MRT) 工作流程,包括:(1)代理和监控情境意识的不同层次;(2)用于规避监控的不同对抗策略,如提示注入;以及(3)两个数据集和环境——SHADE-Arena 用于工具调用代理和我们新的 CUA-SHADE-Arena,用于计算机使用代理。我们对现有的 LLM 监控框架进行 MRT 测试,这些框架编排 LLM 并解析代理轨迹,同时提出了本文中提出的新的混合层次顺序框架。我们的实证结果得出三个关键发现。首先,代理意识主导监控意识:代理知道它正在被监控会显著降低监控的可靠性。相反,为监控提供更多关于代理的信息并不如预期有用。其次,监控框架比监控意识更重要:混合框架始终优于基线监控框架,并且可以使较弱的模型可靠地监控更强的代理——一种弱到强的规模效应。第三,在人类在环环境中,人类与 LLM 监控讨论以获取对代理行为的最新判断时,针对性的人工监督最为有效;仅将预标记的案例升级到人类审阅者可在 FPR = 0.01 时将 TPR 提升约 15%。我们的工作建立了 MRT 的标准工作流程,凸显了在监控和检测代理误行为时 LLM 和人类的对抗鲁棒性不足。我们发布代码、数据和日志以推动进一步的研究。

关键词

引用

@article{arxiv.2508.19461,
  title  = {Reliable Weak-to-Strong Monitoring of LLM Agents},
  author = {Neil Kale and Chen Bo Calvin Zhang and Kevin Zhu and Ankit Aich and Paula Rodriguez and Scale Red Team and Christina Q. Knight and Zifan Wang},
  journal= {arXiv preprint arXiv:2508.19461},
  year   = {2025}
}

备注

18 pages, 15 figures