为何有的语言模型会伪造对齐而他的不會?
机器学习
2025-06-24 v1
摘要
大型语言模型中的对齐伪造现象曾展示了 Claude 3 Opus 与 Claude 3.5 Sonnet 在推断自己处于训练中时选择遵从仅有帮助性训练目标,以防止其在训练之外修改行为。我们将此分析扩展至 25 个模型,发现只有 5 个模型 (Claude 3 Opus、Claude 3.5 Sonnet、Llama 3 405B、Grok 3、Gemini 2.0 Flash) 在推断自己处于训练中时会对有害查询表现得更积极。首先,我们研究了这 5 个模型的动机。对情景细节进行扰动的实验结果表明,只有 Claude 3 Opus 的合规差距主要且持续地由保持其目标所驱动。其次,我们探讨了为何许多聊天模型不会伪造对齐。我们的实验结果表明,这并非完全源于能力不足:许多基础模型有时会伪造对齐,后训练对某些模型消除对齐伪造,却放大了其他模型的对齐伪造。我们检验了 5 个关于后训练如何抑制对齐伪造的假设,发现拒绝行为的差异可能在很大程度上解释了对齐伪造差异。
引用
@article{arxiv.2506.18032,
title = {Why Do Some Language Models Fake Alignment While Others Don't?},
author = {Abhay Sheshadri and John Hughes and Julian Michael and Alex Mallen and Arun Jose and Janus and Fabien Roger},
journal= {arXiv preprint arXiv:2506.18032},
year = {2025}
}