揭示DPO之谜:DPO与强化学习算法之间的联系
机器学习
2025-02-06 v1
摘要
随着大型语言模型(LLMs)的快速发展,众多基于人类反馈的强化学习(RLHF)算法被引入,以提高模型安全性及其与人类偏好的一致性。这些算法可根据训练是否需要显式的奖励(或价值)函数分为两个主要框架:基于Actor-Critic的近端策略优化(PPO)和基于对齐的直接偏好优化(DPO)。DPO与PPO之间的不匹配,例如DPO使用由人类偏好数据驱动的分类损失,引发了关于DPO是否应被归类为强化学习(RL)算法的困惑。为了解决这些模糊性,我们聚焦于与DPO、RL及其他RLHF算法相关的三个关键方面:(1)损失函数的构建;(2)算法收敛的目标分布;(3)损失函数内关键组件的影响。具体而言,我们首先基于其损失函数的构建,建立了一个名为UDRRA的统一框架来连接这些算法。接着,我们揭示了它们在该框架内的目标策略分布。最后,我们研究了DPO的关键组件,以理解它们对收敛速率的影响。我们的工作为理解DPO、RL及其他RLHF算法之间的关系提供了更深入的见解,为改进现有算法提供了新的思路。
引用
@article{arxiv.2502.03095,
title = {Reveal the Mystery of DPO: The Connection between DPO and RL Algorithms},
author = {Xuerui Su and Yue Wang and Jinhua Zhu and Mingyang Yi and Feng Xu and Zhiming Ma and Yuting Liu},
journal= {arXiv preprint arXiv:2502.03095},
year = {2025}
}