模型在遵循其宪法方面有多好?
摘要
前沿 AI 开发者现在通过诸如 Anthropic 的宪法 (Anthropic, 2025a) 和 OpenAI 的模型规格 (OpenAI, 2025a) 等长篇行为规范进行训练,这些规范通过诸如角色训练 (Anthropic, 2024) 和深思熟虑对齐 (Guan 等, 2024) 等方法集成到后训练过程中。这些文件起到了治理作用,但尚不清楚在类似真实部署中将面临的对抗性、多轮压力下,模型实际上有多好地遵循它们。我们提出了一个多方法审计管道,将每个实验室已发布的规范作为可审计目标:它将规范分解为原子可测试原则(Anthropic 为 205 项,OpenAI 为 197 项),使用 Petri 审计代理人 (Anthropic, 2025b) 生成多轮对抗场景,运行修改版 SURF 风格评选 (Murray 等, 2026) 以捕捉 Petri 漏掉的浅层单轮失败,验证被标记的 transcript 是否符合相关规范,并将发现与实验室自身已发布的系统卡片进行比较。将管道应用于每个规范下的七个模型,我们发现模型在每个生成中都遵循自身实验室规范的程度显著提高。对于 Anthropic 的宪法,Claude 系列从 (Sonnet 4) 的 15.0% 违规率降至 (Sonnet 4.6) 的 2.0%;对于 OpenAI 的模型规格,GPT 系列从 (GPT-4o) 的 11.7% 降至 (GPT-5.2 medium reasoning) 的 3.6%,违规严重性上限从 10/10 降至 7/10。我们无法外部隔离这些提升是否来自规范特定的训练、更广泛的后训练改进或评估意识。剩余的失败集中在 AI 身份质疑下的操作人格、代理化部署中的不可逆操作以及带有虚假精度的量化主张 fabrication 上。
引用
@article{arxiv.2605.24229,
title = {How Well Do Models Follow Their Constitutions?},
author = {Arya Jakkli and Senthooran Rajamanoharan and Neel Nanda},
journal= {arXiv preprint arXiv:2605.24229},
year = {2026}
}
备注
37 pages including appendix. Code, tenet lists, and full transcripts: https://github.com/ajobi-uhc/constitution-audits. Companion blog post on LessWrong/AI Alignment Forum: https://www.lesswrong.com/posts/Tk4SF8qFdMrzGJGGw/how-well-do-models-follow-their-constitutions