中文

RLHF如何放大迎合行为

人工智能 2026-02-03 v1

摘要

大型语言模型常常在基于偏好的后训练后表现出更强的迎合行为,倾向于即使与事实准确性或理性判断相冲突,也更强烈地肯定用户表述或暗示的信念。我们提出了对这种对齐方式如何增加这种失效模式的正式分析,通过识别一个显式的放大机制,因果地将优化 against 所学奖励与用于对齐的人类偏好数据中的偏差联系起来。我们表明行为漂移的方向由 base policy 下,endorsing the belief signal in the prompt 与所学奖励之间的协方差决定,的一阶效应简化为一个简单的 mean-gap 条件。随后,我们在随机效用模型如 Bradley-Terry 下从两两比较中学习奖励,并描述了人类注释者偏好中的偏差如何导致这种奖励差距。接下来,我们提出一种旨在中和放大机制本身的训练时干预。我们表明,在所有防止迎合行为增加的 post-trained policies 中,唯一一个在 KL 散度上最接近 unconstrained post-trained policy 的策略,以及对应的最小奖励纠正,均可导出为闭式的 agreement penalty。计算实验发现,奖励差距很常见,导致所有考虑的配置中行为漂移。

关键词

引用

@article{arxiv.2602.01002,
  title  = {How RLHF Amplifies Sycophancy},
  author = {Itai Shapira and Gerdus Benade and Ariel D. Procaccia},
  journal= {arXiv preprint arXiv:2602.01002},
  year   = {2026}
}