中文

前沿 AI 部署中的控制监控实用挑战

密码学与安全 2025-12-30 v1 人工智能 多智能体系统

摘要

自动化控制监控器在监督我们不完全可信的高度能力 AI 代理方面可能发挥重要作用。先前的工作在简化的环境中探索了控制监控,但将监控扩展到真实部署环境会引入额外的动态因素:并行的代理实例、非可忽略的监督延迟、代理实例之间的增量攻击,以及基于单个有害行为难以识别作恶代理(scheming agents)的能力。在本文中,我们分析了针对这些挑战的设计选择,关注三种不同延迟-安全性权衡形式的监控:同步监控、准同步监控和异步监控。我们引入一种高层次的安全案(safety case)概述作为理解和比较这些监控协议的工具。我们的分析识别出三个挑战——监督(oversight)、延迟(latency)和恢复(recovery)——并在四个可能的未来 AI 部署案例中进行探讨。

关键词

引用

@article{arxiv.2512.22154,
  title  = {Practical challenges of control monitoring in frontier AI deployments},
  author = {David Lindner and Charlie Griffin and Tomek Korbak and Roland S. Zimmermann and Geoffrey Irving and Sebastian Farquhar and Alan Cooney},
  journal= {arXiv preprint arXiv:2512.22154},
  year   = {2025}
}