中文

LiPO:基于排序学习的列表式偏好优化

计算与语言 2025-01-28 v3 机器学习

摘要

将语言模型(LM)与精选的人类反馈对齐对于控制其在实际应用中的行为至关重要。近期的一些策略优化方法,如 DPO 和 SLiC,作为传统的人类反馈强化学习(RLHF)方法的有前景的替代方案。在实践中,为了分摊阅读提示词的成本,人类反馈通常以对多个响应的排序列表形式给出。多个响应也可以由奖励模型或 AI 反馈进行排序。目前缺乏对直接在响应列表上进行拟合的透彻研究。在本工作中,我们将 LM 对齐形式化为一个列表式(listwise)排序问题,并描述了 LiPO 框架,在该框架中,策略可以更有效地从给定提示词的合理响应排序列表中进行学习。这一观点将其与排序学习(LTR)建立了明确联系,大多数现有的偏好优化工作都可以映射到现有的排序目标上。遵循这一联系,我们考察了在 LM 对齐中尚未得到充分研究的排序目标,并将 DPO 和 SLiC 视为列表大小为 2 时的特例。特别地,我们强调了一种特定方法 LiPO-λ\lambda,它利用了最先进的列表式排序目标,并以更先进的方式对每个偏好对进行加权。我们表明,在使用精选和真实的列表式偏好数据的多个偏好对齐任务上,LiPO-λ\lambda 能够以明显的优势胜过 DPO 变体和 SLiC。

关键词

引用

@article{arxiv.2402.01878,
  title  = {LiPO: Listwise Preference Optimization through Learning-to-Rank},
  author = {Tianqi Liu and Zhen Qin and Junru Wu and Jiaming Shen and Misha Khalman and Rishabh Joshi and Yao Zhao and Mohammad Saleh and Simon Baumgartner and Jialu Liu and Peter J. Liu and Xuanhui Wang},
  journal= {arXiv preprint arXiv:2402.01878},
  year   = {2025}
}

备注

Accepted at NAACL 2025