基于Bradley-Terry模型的政策优化用于生成式偏好建模
机器学习
2026-03-11 v3
摘要
强化学习(RL)最近在大型语言模型中有效扩展链条推理(chain-of-thought, CoT),适用于答案可验证的任务。然而,将基于RL的思维训练扩展到更一般的非可验证任务——其中监督仅通过成对的人类偏好提供——仍存在挑战。现有方法通常以启发式方式将针对可验证奖励设计的RL目标应用于偏好基环境。在本工作中,我们表明,在偏好建模中引入CoT推理从根本上改变了Bradley-Terry(BT)似然的结构,因为推理过程必须作为潜在变量来处理。这导致偏好似然表达为随机生成轨迹上期望值的比,无法通过 Jensen 不等式或标准RL目标进行优化。为解决此挑战,我们推导了用于优化该似然梯度的一致蒙特卡洛估计,形成Bradley-Terry政策优化(BTPO)方法。实验结果表明,BTPO能够稳定有效地训练具备CoT推理的生成式偏好模型,在多个基准测试和模型规模上 consistently 优于先前的启发式方法。
引用
@article{arxiv.2510.15242,
title = {Bradley-Terry Policy Optimization for Generative Preference Modeling},
author = {Shengyu Feng and Yun He and Shuang Ma and Beibin Li and Yuanhao Xiong and Songlin Li and Karishma Mandyam and Julian Katz-Samuels and Shengjie Bi and Licheng Yu and Hejia Zhang and Karthik Abinav Sankararaman and Han Fang and Yiming Yang and Manaal Faruqui},
journal= {arXiv preprint arXiv:2510.15242},
year = {2026}
}