REBEL:通过回归相对奖励进行强化学习
机器学习
2024-12-11 v4 计算与语言
计算机视觉与模式识别
摘要
虽然近端策略优化(PPO)最初是为连续控制问题开发的,但它已成为各种强化学习(RL)应用的主力工具,包括生成模型的微调。遗憾的是,PPO 需要多种启发式方法才能实现稳定收敛(例如价值网络、截断),并且以其对这些组件的精确实现的敏感性而臭名昭著。作为回应,我们退后一步,询问在生成模型时代,一个极简主义的 RL 算法会是什么样子。我们提出了 REBEL,这是一种算法,它将策略优化问题干净地简化为在策略方面对提示的两个补全之间的相对奖励进行回归,从而实现了极其轻量级的实现。在理论上,我们证明了像自然策略梯度这样的基本 RL 算法可以看作是 REBEL 的变体,这使我们能够匹配 RL 文献中关于收敛性和样本复杂度的最强已知理论保证。REBEL 还可以干净地整合离线数据,并扩展以处理我们在实践中经常看到的非传递性偏好。在实验上,我们发现 REBEL 为语言建模和图像生成提供了一种统一的方法,其性能优于或类似于 PPO 和 DPO,同时比 PPO 更易于实现且计算效率更高。在对 Llama-3-8B-Instruct 进行微调时,REBEL 在 AlpacaEval 2.0、MT-Bench 和 Open LLM Leaderboard 中取得了强劲的表现。
引用
@article{arxiv.2404.16767,
title = {REBEL: Reinforcement Learning via Regressing Relative Rewards},
author = {Zhaolin Gao and Jonathan D. Chang and Wenhao Zhan and Owen Oertell and Gokul Swamy and Kianté Brantley and Thorsten Joachims and J. Andrew Bagnell and Jason D. Lee and Wen Sun},
journal= {arXiv preprint arXiv:2404.16767},
year = {2024}
}
备注
New experimental results on general chat