中文

异步控制:对 LLM 代理的异步控制措施进行压力测试

机器学习 2025-12-16 v1

摘要

LLM 基于的软件工程代理日益用于实际开发任务,常常可访问敏感数据或安全关键的代码库。这些代理如果存在对齐问题,可能会有意识地破坏这些代码库。我们研究异步监控,即监控系统在事后审查代理动作的机制。与同步监控不同,异步监控不施加运行时延迟,同时仍试图在不可逆损害发生前干扰攻击。我们将监控开发视为蓝队(设计监控方)与红队(创建破坏性代理方)之间的对抗游戏。我们尝试设定游戏规则,以对基于 Claude 4.1 Opus 的代理的破坏潜力进行上限控制。为将该游戏置于现实、高风险的部署情景中,我们开发了 5 个多样化的软件工程环境,模拟代理可能在 AI 开发者内部基础设施中执行的任务。在游戏过程中,我们开发了一个集成监控器,在 held out 测试环境中实现 1% 假阳性率下的 6% 假阴性率。随后,我们通过从监控器的假阴性率外推,在部署时估计破坏风险。我们描述了一个简单的外推模型、敏感性分析,并描述了该模型在何时会失效的情况。代码可用:https://github.com/UKGovernmentBEIS/async-control。

关键词

引用

@article{arxiv.2512.13526,
  title  = {Async Control: Stress-testing Asynchronous Control Measures for LLM Agents},
  author = {Asa Cooper Stickland and Jan Michelfeit and Arathi Mani and Charlie Griffin and Ollie Matthews and Tomek Korbak and Rogan Inglis and Oliver Makins and Alan Cooney},
  journal= {arXiv preprint arXiv:2512.13526},
  year   = {2025}
}