重审布拉德-蒂里模型在偏好基奖励建模中的应用:基础理论与替代方案
人工智能
2025-01-28 v2
摘要
布拉德-蒂里 (Bradley-Terry, BT) 模型是奖励建模中大语言模型 (LLM) 对齐的常见且成功的做法。然而,仍不清楚为何这个最初为多玩家随机游戏匹配开发的模型,能够被采用将两两响应比较转换为奖励值并进行预测。尤其是在只有少数量的提示-响应对被稀疏地与其他样本进行比较的情形下。本文首先重访了在奖励建模中使用 BT 模型的基础理论,基于嵌入技术建立了基于深度神经网络的 BT 奖励模型收敛速率,为其使用提供了理论依据。尽管理论上严谨,但我们从下游优化的角度出发,认为 BT 模型并非必要选择,因为奖励模型仅需通过对真实奖励的单调变换保持正确的排序预测即可。我们强调奖励建模中关键的序一致性概念,并展示 BT 模型具备该属性。因此,我们提出一种简单直接的上界算法,兼容现有的二分类器,作为替代性序一致奖励建模目标。为提供实际见解,我们在超过 12,000 个实验设置下评估了这些不同奖励建模方法的性能,涉及 6 个基础大语言模型、2 个数据集,以及多样化的标注设计,这些设计在标注数量、质量和偏好标注中的配对选择上存在差异。
引用
@article{arxiv.2411.04991,
title = {Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives},
author = {Hao Sun and Yunyi Shen and Jean-Francois Ton},
journal= {arXiv preprint arXiv:2411.04991},
year = {2025}
}