中文

生成式奖励模型

机器学习 2024-10-18 v1

摘要

基于人类反馈的强化学习(RLHF)显著提升了现代大型语言模型(LLM)的性能。RLHF 过程资源密集且技术挑战大,通常需要大量人类对模型生成输出的偏好标签。基于 LLM 生成的合成偏好(RLAIF)通过利用 LLM 生成的合成偏好来解决数据收集挑战。然而,最近的研究表明,合成偏好标签可能与人类偏好判断不一致。为此,我们提出了一种统合 RLHF 和 RLAIF 方法的混合方法。我们引入 GenRM,这是一个迭代算法,训练 LLM 自行生成推理痕迹,产生与人类偏好判断相匹配的合成偏好标签。经验上,我们表明,零-shot LLM 基于判断的表现在分布内任务上不如 Bradley-Terry 奖励模型(差距达 9-36%)。相比之下,GenRM 在分布内准确率接近 Bradley-Terry 模型,而在分布外任务上显著优于它们(提升 10-45%)。此外,GenRM 在分布内(提升 9-31%)和分布外任务(提升 2-6%)上均优于使用 LLM 作为判官的性能。我们的结果表明,将 RLHF 和 RLAIF 的优势结合为一,为提高合成偏好标签的质量提供了有前景的ethods。

关键词

引用

@article{arxiv.2410.12832,
  title  = {Generative Reward Models},
  author = {Dakota Mahan and Duy Van Phung and Rafael Rafailov and Chase Blagden and Nathan Lile and Louis Castricato and Jan-Philipp Fränken and Chelsea Finn and Alon Albalak},
  journal= {arXiv preprint arXiv:2410.12832},
  year   = {2024}
}