中文

论直接偏好优化诱导的隐式奖励模型的有限泛化能力

机器学习 2024-10-04 v2 计算与语言

摘要

基于人类反馈的强化学习 (RLHF) 是使语言模型与人类偏好对齐的有效方法。RLHF 的核心是学习用于对人类偏好进行评分的奖励函数。学习奖励模型的两种主要方法是:1) 如在 RLHF 中训练显式奖励模型 (EXRM),以及 2) 使用通过直接偏好优化 (DPO) 等方法从偏好数据中学习的隐式奖励。先前的工作表明,DPO 的隐式奖励模型(记为 DPORM)在极限情况下可以近似 EXRM。DPORM 的有效性直接意味着所学策略的最优性,并且对包括迭代 DPO 在内的 LLM 对齐方法具有实际意义。然而,目前尚不清楚 DPORM 在经验上能在多大程度上匹配 EXRM 的性能。本工作研究了 DPORM 和 EXRM 在区分偏好答案和拒绝答案方面的准确性。我们的研究结果表明,尽管 DPORM 对训练数据集的拟合程度相当,但其泛化能力不如 EXRM,尤其是当验证数据集包含分布偏移时。在五个分布外设置中,DPORM 的准确率平均下降 3%,最大下降 7%。这些发现表明 DPORM 的泛化能力有限,并证实了在迭代 DPO 方法中整合显式奖励模型的必要性。

关键词

引用

@article{arxiv.2409.03650,
  title  = {On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization},
  author = {Yong Lin and Skyler Seto and Maartje ter Hoeve and Katherine Metcalf and Barry-John Theobald and Xuan Wang and Yizhe Zhang and Chen Huang and Tong Zhang},
  journal= {arXiv preprint arXiv:2409.03650},
  year   = {2024}
}

备注

12 pages, 8 tables, 3 figures; Paper Accepted at EMNLP Findings 2024