奖励偏置替代:单轴偏差缓解转向优化压力
人工智能
2026-05-28 v1
摘要
对奖励模型偏差(例如减少对长度、迎合或风格的依赖)的单轴缓解可能在相关代理上旋转优化压力,而非消除它,这是一种我们称为奖励偏置替代的失败模式。该失败由审计和策略训练期间审计分布与策略诱导分布之间的测量与优化之间的差距所启用。我们将缓解结果形式化为一个体系分类,并证明了成功缓解、偏置替代和过度纠正在任何审计分布评分下(包括排序准确率和赢率)都会产生相同的可观察结果,即使获得对真实奖励的神秘访问。在我们调查的已发表偏好学习缓解工作中,没有一种方法报告了证明成功缓解所需的证据。通过在策略诱导分布上增强评估并跟踪多个偏差,必然能够缩小差距,我们将这一点转化为针对缓解方法和基准的可操作性建议。我们在语言模型 RLHF 中演示了偏置替代,其中在 GRPO 训练期间对长度的惩罚如原意一样压缩响应,但将优化压力定向到置信度校准上,导致策略进入过度自信,而事实自由格式准确率下降。我们还展示了一个在审计分布上对奖励-长度相关性为零的已发表长度去偏差算子,但在四个 SOTA 奖励模型中进行最佳-N选择时重新引入偏差,以及一个长度-迎合耦合,其方向在人类-LLM 评判不一致时反转。
引用
@article{arxiv.2605.27996,
title = {Reward Bias Substitution: Single-Axis Bias Mitigations Redirect Optimization Pressure},
author = {Max Lamparth and Daniel Fein and Andreas Haupt and Marcel Hussing and Mykel J. Kochenderfer},
journal= {arXiv preprint arXiv:2605.27996},
year = {2026}
}