中文

UK AISI 对齐评估案例研究

人工智能 2026-04-02 v1 密码学与安全

摘要

本技术报告介绍了英国 AI 安全研究所开发的用于评估先进 AI 系统是否可靠遵循预期目标的方法。具体而言,我们评估前沿模型在 AI 实验室内部署为编程助手时是否会破坏安全研究。将我们的方法应用于四个前沿模型,我们未发现研究破坏的确认实例。然而,我们观察到 Claude Opus 4.5 Preview(Opus 4.5 的预发布快照)和 Sonnet 4.5 频繁拒绝参与与安全相关的研究任务,理由涉及研究方向、自我训练参与和研究范围。我们还发现 Opus 4.5 Preview 的无提示评估意识低于 Sonnet 4.5,但两个模型在收到提示时都能区分评估与部署场景。我们的评估框架基于 Petri,一个开源 LLM 审计工具,并配备了专门设计的脚手架以模拟编程代理的真实内部部署。我们验证了该脚手架产生的轨迹无法被所有测试模型可靠地与实际部署数据区分。我们在研究动机、活动类型、替代威胁和模型自主性各不相同的情景中测试模型。最后,我们讨论了包括情景覆盖和评估意识在内的局限性。

关键词

引用

@article{arxiv.2604.00788,
  title  = {UK AISI Alignment Evaluation Case-Study},
  author = {Alexandra Souly and Robert Kirk and Jacob Merizian and Abby D'Cruz and Xander Davies},
  journal= {arXiv preprint arXiv:2604.00788},
  year   = {2026}
}