基于有序反馈的奖励建模:群体智慧
机器学习
2024-11-21 v1 人工智能
计算与语言
机器学习
摘要
从人类偏好中学习奖励模型(RM)一直是对齐大型语言模型(LLM)的重要组成部分。从成对偏好数据中学习 RM 的经典设定源于经典的 Bradley-Terry (BT) 模型,该模型接受二元反馈,即标签为“回复 1 优于回复 2”或反之。这种设定不可避免地丢弃了潜在有用的样本(例如两个回复之间的“平局”),并丢失了更细粒度的信息(例如“略好”)。在本文中,我们提出了一个在有序反馈下学习 RM 的框架,将二元偏好反馈的情况推广到任意粒度。具体而言,我们首先识别了一个边际无偏性条件,该条件推广了现有二元反馈设定中 BT 模型的假设。该条件通过“群体智慧”的社会学概念得到了验证。在此条件下,我们为有序反馈下的成对偏好数据开发了一个自然的概率模型,并分析了其性质。我们证明了与二元反馈相比,有序反馈在降低 Rademacher 复杂度方面的统计学优势。所提出的学习目标和理论也扩展至 hinge loss 和直接策略优化(DPO)。特别是,当应用于看似不相关的知识蒸馏问题以解释其中的偏差-方差权衡时,理论分析可能具有独立的意义。该框架也为人类标注者的编写指南提供了启示。我们的数值实验验证了细粒度反馈在分布内和分布外设置下都能带来更好的奖励学习。进一步的实验表明,纳入一定比例的平局偏好样本能促进 RM 学习。
引用
@article{arxiv.2411.12843,
title = {Reward Modeling with Ordinal Feedback: Wisdom of the Crowd},
author = {Shang Liu and Yu Pan and Guanting Chen and Xiaocheng Li},
journal= {arXiv preprint arXiv:2411.12843},
year = {2024}
}