中文

在直接偏好优化中解耦长度与质量

计算与语言 2024-09-10 v2 机器学习

摘要

人类反馈强化学习(RLHF)一直是大型语言模型近期成功的关键组件。然而,已知 RLHF 会利用人类偏好中的偏差,例如冗长性。一个格式良好且文辞优美的回答通常会得到用户更高的评价,即使它缺乏帮助性和客观性。在经典的 RLHF 文献中已经开发了许多方法来控制这些偏差,但对于直接对齐算法(如直接偏好优化,DPO)而言,该问题仍相对缺乏探索。与经典 RLHF 不同,DPO 不训练单独的奖励模型或直接使用强化学习,因此先前开发的用于控制冗长性的方法不能直接应用于此设置。我们的工作做出了几项贡献。我们首次研究了 DPO 设置中的长度问题,展示了 DPO 中显著的利用行为并将其与分布外自举联系起来。然后,我们开发了一种有原则但简单的正则化策略,该策略可防止长度利用,同时仍保持模型质量的提升。我们在摘要和对话数据集上展示了这些效果,在控制长度的情况下,尽管 GPT4 评判者存在众所周知的冗长偏差,我们的胜率仍提高了高达 20%。

关键词

引用

@article{arxiv.2403.19159,
  title  = {Disentangling Length from Quality in Direct Preference Optimization},
  author = {Ryan Park and Rafael Rafailov and Stefano Ermon and Chelsea Finn},
  journal= {arXiv preprint arXiv:2403.19159},
  year   = {2024}
}