评估 AI 模型是否会破坏 AI 安全研究
人工智能
2026-04-28 v1
摘要
我们评估了前沿模型在前沿 AI 公司内部作为 AI 研究智能体部署时,破坏或拒绝协助安全研究的倾向。我们对四个 Claude 模型(Mythos Preview、Opus 4.7 Preview、Opus 4.6 和 Sonnet 4.6)应用了两种互补的评估:一种是无提示破坏评估,测试模型在有机会破坏安全研究时的行为;另一种是破坏延续评估,测试模型在置于先前行动已开始破坏研究的轨迹中时是否会继续破坏。我们在任何模型中均未发现无提示破坏的实例,其中 Mythos Preview 和 Opus 4.7 Preview 的拒绝率接近于零,尽管所有模型有时仅部分完成任务。在延续评估中,Mythos Preview 在 7% 的情况下主动继续破坏(相比之下,Opus 4.6 为 3%,Sonnet 4.6 为 4%,Opus 4.7 Preview 为 0%),并且在大多数此类情况下表现出推理输出差异,表明存在隐蔽的破坏推理。我们的评估框架建立在开源 LLM 审计工具 Petri 的基础之上,使用自定义脚手架在 Claude Code 内运行模型,并辅以生成逼真破坏轨迹的迭代流程。我们测量了评估意识以及一种被称为“预填充意识”的新型情境意识,即识别先前轨迹内容并非自身生成的能力。Opus 4.7 Preview 表现出显著升高的无提示评估意识,而所有模型的预填充意识仍然较低。最后,我们讨论了局限性,包括评估意识混淆、有限的场景覆盖范围以及超出安全研究破坏之外的未经测试的风险路径。
引用
@article{arxiv.2604.24618,
title = {Evaluating whether AI models would sabotage AI safety research},
author = {Robert Kirk and Alexandra Souly and Kai Fronsdal and Abby D'Cruz and Xander Davies},
journal= {arXiv preprint arXiv:2604.24618},
year = {2026}
}