中文

用于不对齐前沿代理的密码激活关闭协议

密码学与安全 2025-12-04 v1 人工智能 计算机与社会 机器学习

摘要

前沿 AI 开发者可能未能对齐或控制高能力 AI 代理。在许多情况下,拥有能够有效防止不对齐代理在世界范围内执行有害操作的紧急关闭机制会很有用。我们引入了密码激活关闭协议(PAS 协议)——一种设计前沿代理以在给定密码时实现安全关闭协议的方法。我们通过描述直观的使用场景来为 PAS 协议提供动机,在这些场景中,它们缓解了绕过其他控制努力的不对齐系统的风险,例如禁用自动监控或自我外泄到外部数据中心。PAS 协议补充了其他安全努力,如对齐微调或监控,有助于构建针对 AI 风险的纵深防御。我们在 SHADE-Arena(一个用于 AI 监控和颠覆能力的基准)中提供了具体演示,其中 PAS 协议补充监控以提高安全性,同时对性能影响很小。接下来,PAS 协议应能抵御想要绕过关闭的恶意行为者。因此,我们在开发者(蓝队)和试图颠覆协议的红队之间进行了红蓝对抗游戏。我们在代码生成设置中进行了实验,发现红队有有效的策略,例如使用另一个模型过滤输入,或微调模型以阻止关闭行为。然后我们概述了在真实系统中实现 PAS 协议的关键挑战,包括密码的安全考虑以及何时和在哪些系统中使用它们的决策。PAS 协议是提高前沿 AI 安全性的直观机制。我们鼓励开发者在部署特别危险的系统之前考虑实施 PAS 协议,以降低失控风险。

关键词

引用

@article{arxiv.2512.03089,
  title  = {Password-Activated Shutdown Protocols for Misaligned Frontier Agents},
  author = {Kai Williams and Rohan Subramani and Francis Rhys Ward},
  journal= {arXiv preprint arXiv:2512.03089},
  year   = {2025}
}