当距离产生干扰:BT-Loss中奖励模型的表示距离偏差
机器学习
2026-02-03 v2 人工智能
计算与语言
摘要
奖励模型是RLHF框架内大型语言模型(LLM)对齐的核心。奖励建模中使用的标准目标是Bradley-Terry(BT)损失,它从由选择响应和拒绝响应组成的成对数据中学习。在本工作中,我们分析了BT损失的逐样本梯度,并展示了由于表示距离而产生的虚假学习信号。具体而言,BT梯度范数由两个不同分量缩放:(1)由选择响应和拒绝响应之间预测奖励差异反映的预测误差,以及(2)由输出空间最后一层测量的成对表示距离。虽然第一项捕获了预期的训练信号,但第二项可能显著影响更新幅度并使学习错位。具体而言,表示距离较小的成对数据即使被错误排序也往往获得极弱的更新,而表示距离较大的成对数据则获得不成比例的强更新。这导致大距离对的梯度掩盖了小距离对的梯度,而在小距离对中,细粒度区分尤为重要。为了克服这一限制,我们提出了NormBT,一种自适应成对归一化方案,重新缩放更新以平衡表示驱动效应并将学习信号聚焦于预测误差。NormBT是对BT损失的轻量级即插即用修改,开销可忽略不计。在各种LLM骨干网络和数据集上,NormBT一致地改善了奖励模型性能,在包含大量细粒度对的RewardBench推理类别上获得了超过5%的显著提升。
引用
@article{arxiv.2512.06343,
title = {When Distance Distracts: Representation Distance Bias in BT-Loss for Reward Models},
author = {Tong Xie and Andrew Bai and Yuanhao Ban and Yunqi Hong and Haoyu Li and Cho-jui Hsieh},
journal= {arXiv preprint arXiv:2512.06343},
year = {2026}
}