事后奖励校准:关于长度偏差的案例研究
人工智能
2025-09-23 v2 计算与语言
摘要
基于人类反馈的强化学习(RLHF)将大型语言模型(LLM)的输出与人类价值观和偏好对齐。这一过程的核心是奖励模型(RM),它将人类反馈转化为用于优化LLM行为的训练信号。然而,RM可能会通过利用其训练数据中的虚假相关性而产生偏差,例如偏好基于长度或风格的输出而非真实质量。这些偏差可能导致错误的输出排名、次优的模型评估,以及在LLM对齐中放大不良行为。本文解决了在没有额外数据和训练的情况下纠正此类偏差的挑战,引入了事后奖励校准的概念。我们首先提出一种直观的方法来估计偏差项,从而将其移除,以近似潜在的真实奖励。然后,我们通过局部加权回归将该方法扩展为更通用、更稳健的形式。针对普遍存在的长度偏差,我们在三个实验设置中验证了我们提出的方法,并展示了一致的改进:(1)在RewardBench数据集上,33个奖励模型的平均性能提升了3.11;(2)基于AlpacaEval基准,RM排名与GPT-4评估和人类偏好的一致性得到增强;(3)在多个LLM-RM组合中,RLHF过程的长度控制胜率得到提高。我们的方法计算效率高,并且可推广到其他类型的偏差和RM,为减轻LLM对齐中的偏差提供了一个可扩展且稳健的解决方案。我们的代码和结果可在https://github.com/ZeroYuHuang/Reward-Calibration获取。
引用
@article{arxiv.2409.17407,
title = {Post-hoc Reward Calibration: A Case Study on Length Bias},
author = {Zeyu Huang and Zihan Qiu and Zili Wang and Edoardo M. Ponti and Ivan Titov},
journal= {arXiv preprint arXiv:2409.17407},
year = {2025}
}
备注
ICLR 2025