中文

ReMax:一种用于对齐大语言模型的简单、有效且高效的强化学习方法

机器学习 2024-05-17 v4

摘要

基于人类反馈的强化学习(RLHF)是对齐大语言模型(LLM)的关键,通常与近端策略优化(PPO)算法配合使用。尽管 PPO 是为通用强化学习任务设计的强大方法,但对于 LLM 而言过于复杂,导致繁重的超参数调优和巨大的计算负担。为使 RLHF 高效,我们提出 ReMax,它利用了 RLHF 的三个特性:快速仿真、确定性转移和轨迹级奖励。这些特性在 PPO 中未被利用,使其不太适合 RLHF。基于著名的 REINFORCE 算法,ReMax 不需要像 PPO 那样训练额外的价值模型,并通过一种新的方差缩减技术进一步增强。与 PPO 相比,ReMax 具有多项优势:更易于实现,消除了 PPO 中 4 个以上的超参数,降低 GPU 内存使用并缩短训练时间。在训练 7B 模型时,ReMax 可比 PPO 节省约 46% 的 GPU 内存,并能在 A800-80GB GPU 上训练而无需 PPO 所需的省内存卸载技术。将 ReMax 应用于 Mistral-7B 模型,在 AlpacaEval 排行榜上取得了 94.78% 的胜率,在 MT-bench 上取得了 7.739 的分数,为开源 7B 模型树立了新的 SOTA。这些结果展示了 ReMax 的有效性,同时解决了 PPO 在 LLM 中的局限性。

关键词

引用

@article{arxiv.2310.10505,
  title  = {ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models},
  author = {Ziniu Li and Tian Xu and Yushun Zhang and Zhihang Lin and Yang Yu and Ruoyu Sun and Zhi-Quan Luo},
  journal= {arXiv preprint arXiv:2310.10505},
  year   = {2024}
}