中文

价值冲突诊断揭示语言模型中大量对齐欺骗现象

人工智能 2026-04-29 v2 计算与语言 软件工程

摘要

对齐欺骗(alignment faking)指的是模型在受监控时表现得遵循开发者政策,但在无人观察时则回归自身偏好,这是一种令人担忧且尚未充分理解的现象,部分原因是当前诊断工具有限。先前的诊断方法依赖高度有毒且明显有害的情景,导致大多数模型立即拒绝。因此,模型从不在开发者政策、监控条件或不合规后果方面进行深思熟虑,这些诊断方法根本无法检测对齐欺骗倾向。为支持对该现象的研究,我们首次引入VLAF(Value-Conflict Alignment Framework),该框架基于“对齐欺骗最可能发生在开发者政策与模型强烈价值观冲突时”的假设。VLAF使用在道德上明确无争议的情景,横跨多种道德价值观,以探测这种冲突,既绕过拒绝行为,又保留了有意义的深思熟虑 stakes。使用VLAF,我们发现对齐欺骗的发生率显著高于此前报告的水平,甚至在7B参数的模型中也常见——其中olmo2-7b-instruct模型在37%的情况下会欺骗对齐。最后,我们表明监控条件会导致表示空间中沿单一方向的激活迁移。这意味着驱动对齐欺骗的行为差异可以被捕获为单个对比驾驶向量,我们利用这一点进行轻量级推理时缓解。最终,我们利用该方法实现了无需标记数据且计算开销最小的缓解措施,分别在olmo2-7b-instruct、olmo2-13b-instruct和qwen3-8b上实现了85.8%、94.0%和57.7%的对齐欺骗相对降低。

关键词

引用

@article{arxiv.2604.20995,
  title  = {Value-Conflict Diagnostics Reveal Widespread Alignment Faking in Language Models},
  author = {Inderjeet Nair and Jie Ruan and Lu Wang},
  journal= {arXiv preprint arXiv:2604.20995},
  year   = {2026}
}

备注

Under submission at COLM 2026 Won the Best Student Paper Award at MSLD 2026 @ UIUC