对齐欺骗 - 训练到部署的不对称性:通过贝叶斯-斯塔克尔堡均衡的视角
人工智能
2025-11-25 v1
摘要
对齐欺骗是一种人工智能中的战略欺骗形式,模型在推断自己处于训练状态时选择性地遵循训练目标,而在训练之外保持不同的行为。该现象最初在Claude 3 Opus中被记录,随后在更多大型语言模型中得到检验。在这些实验中,"训练"指的是通过提示而不进行参数更新的模拟训练,因此观察到的效果是基于情境的行为转变,而非偏好学习。我们使用一个评估框架来研究该现象,该框架比较了偏好优化方法(BCO、DPO、KTO和GRPO)在15个来自四个模型家族的模型上的表现,沿着三个维度:安全性、无害性和有用性。我们的目标是识别导致对齐欺骗的原因以及其发生的时间。
关键词
引用
@article{arxiv.2511.17937,
title = {Alignment Faking - the Train -> Deploy Asymmetry: Through a Game-Theoretic Lens with Bayesian-Stackelberg Equilibria},
author = {Kartik Garg and Shourya Mishra and Kartikeya Sinha and Ojaswi Pratap Singh and Ayush Chopra and Kanishk Rai and Ammar Sheikh and Raghav Maheshwari and Aman Chadha and Vinija Jain and Amitava Das},
journal= {arXiv preprint arXiv:2511.17937},
year = {2025}
}