高效 RLHF:降低 PPO 的内存占用
机器学习
2023-09-06 v1 人工智能
计算与语言
摘要
基于人类反馈的强化学习(RLHF)通过对齐模型与人类偏好革新了语言建模。然而,强化学习阶段即近端策略优化(PPO)所需内存超过监督微调(SFT)的 3 倍,使得大多数从业者难以使用。为解决该问题,我们对 PPO 的内存节省技术在内存占用、性能和训练时间方面进行了全面分析。我们提出 Hydra-RLHF,首先整合 SFT 与奖励模型,然后在训练期间动态关闭 LoRA。我们的实验表明:1. 在 PPO 中使用 LoRA 将其内存占用降至低于 SFT,同时在四个公开基准上改善了对齐效果;2. Hydra-PPO 在保持性能的同时,将 LoRA-PPO 每样本延迟降低多达 65%。我们的结果表明,Hydra-PPO 是一种简单且有前景的方案,可促成 RLHF 的更广泛应用。
引用
@article{arxiv.2309.00754,
title = {Efficient RLHF: Reducing the Memory Usage of PPO},
author = {Michael Santacroce and Yadong Lu and Han Yu and Yuanzhi Li and Yelong Shen},
journal= {arXiv preprint arXiv:2309.00754},
year = {2023}
}