中文

超越Bradley-Terry模型:面向语言模型对齐的通用偏好模型

人工智能 2025-06-12 v3 计算与语言 机器学习

摘要

建模人类偏好是将基础模型与人类价值观对齐的关键任务。传统的奖励建模方法,如Bradley-Terry(BT)奖励模型,在表征力上不足,尤其难以处理非传递偏好。本文引入偏好嵌入(preference embedding)方法,通过将响应嵌入到潜在空间中来高效捕捉复杂的偏好结构,实现线性查询复杂度。此外,我们提出了基于偏好得分的通用偏好优化(General Preference Optimization, GPO),其将从人类反馈的强化学习(RLHF)推广为更一般的框架。实验结果表明,我们的通用偏好嵌入模型(General Preference Model, GPM)在RewardBench基准上 consistently优于BT奖励模型,并能有效建模任何BT奖励模型都会表现为随机猜测的循环偏好。此外,在AlpacaEval2.0等下游任务上的评估显示,使用GPO和我们通用偏好模型进行的后训练语言模型性能优于BT模型。这些发现表明,我们的方法可能增强了基础模型与细腻人类价值观的对齐。代码已公开于https://github.com/general-preference/general-preference-model。

关键词

引用

@article{arxiv.2410.02197,
  title  = {Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment},
  author = {Yifan Zhang and Ge Zhang and Yue Wu and Kangping Xu and Quanquan Gu},
  journal= {arXiv preprint arXiv:2410.02197},
  year   = {2025}
}

备注

Accepted to the 42nd International Conference on Machine Learning (ICML 2025)