中文

超越标量奖励模型:从偏好数据中学习生成式评判器

计算与语言 2025-09-03 v2 人工智能 机器学习

摘要

从偏好反馈中学习是对齐大型语言模型(LLM)以符合人类价值观的常见做法。传统上,偏好数据被学习并编码为产生用于偏好或奖励的标量得分的标量奖励模型,该模型将价值头与LLM相连接。然而,标量模型缺乏可解释性,且已知对数据集中的偏见高度敏感。本文研究利用LLM的生成能力来同时解决这两个局限性。具体而言,我们提示预训练的LLM生成正负判断,两者都以自然语言形式提供论据。所生成的自生成对比判断对用于训练生成式评判器。使用直接偏好优化(DPO)训练生成式评判器。通过生成的论据与判断,本文提出的训练生成式评判器(Con-J)的方法确保了由于生成论据与判断的自然可解释性,以及无需额外奖励头即可对偏见具有高度鲁棒性。实验结果表明,Con-J的性能与在相同偏好数据集合上训练的标量奖励模型相当,并且展示了其在编码人类偏好方面的优越可解释性和鲁棒性。

关键词

引用

@article{arxiv.2410.03742,
  title  = {Beyond Scalar Reward Model: Learning Generative Judge from Preference Data},
  author = {Ziyi Ye and Xiangsheng Li and Qiuchi Li and Qingyao Ai and Yujia Zhou and Wei Shen and Dong Yan and Yiqun Liu},
  journal= {arXiv preprint arXiv:2410.03742},
  year   = {2025}
}