DPO 是否优于 PPO 用于大语言模型对齐?综合研究
计算与语言
2024-10-11 v3
摘要
强化学习从人类反馈(RLHF)是目前最广泛使用的用于将大型语言模型(LLMs)对齐于人类偏好的 метод。现有的 RLHF 方法大致可分为基于奖励的或无奖励的。诸如 ChatGPT 和 Claude 等新兴应用利用基于奖励的方法,首先学习奖励模型,然后应用 actor-critic 算法,如近端策略优化(PPO)。然而,在学术基准测试中,往往通过无奖励的方法(如直接偏好优化,DPO)实现最佳成绩。DPO 真的优于 PPO 吗?为何 PPO 在这些基准测试中表现不佳?本文首先通过理论和实证研究,考察 DPO 和 PPO 的算法属性,表明 DPO 可能存在根本性的局限性。此外,我们也全面考察 PPO,揭示在微调大型语言模型时,PPO 实现最佳性能的关键因素。最后,我们在一系列 RLHF 测试环境中对 DPO 和 PPO 进行基准测试,涵盖从对话到代码生成。实验结果表明,PPO 在所有情况下都能超越其他对齐方法,并在具有挑战性的代码竞赛中实现最佳成绩。我们的代码已公开于 https://github.com/openpsi-project/ReaLHF。
引用
@article{arxiv.2404.10719,
title = {Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study},
author = {Shusheng Xu and Wei Fu and Jiaxuan Gao and Wenjie Ye and Weilin Liu and Zhiyu Mei and Guangju Wang and Chao Yu and Yi Wu},
journal= {arXiv preprint arXiv:2404.10719},
year = {2024}
}
备注
16 pages, 2 figures, 14 tables