OPPO:通过流水线重叠加速基于 PPO 的 RLHF
机器学习
2026-03-06 v2
摘要
基于近端策略优化(PPO)的从人类反馈中进行强化学习(RLHF)是一种广泛采用的范式,用于使大语言模型(LLM)与人类偏好对齐。然而,其训练流水线由于顺序的多模型依赖(例如,奖励模型依赖于行动者模型的输出)和长尾响应长度而效率低下,少数长响应会拖延整个阶段的完成。我们提出了 OPPO,一个新颖、轻量级且与模型无关的基于 PPO 的 RLHF 框架,它通过重叠流水线执行来提高训练效率。OPPO 引入了两种新技术:(1)步内重叠,它以合适大小的块流式传输上游模型(例如,行动者模型)的输出,使下游模型(例如,奖励模型)能够在上游继续解码的同时开始预填充;(2)步间重叠,它自适应地超额提交少量提示,并将过长的生成推迟到未来的步骤,从而在不丢弃部分工作的情况下缓解尾部延迟。OPPO 通过一个轻量级封装器即可轻松集成到现有的 PPO 实现中。广泛的评估表明,OPPO 将基于 PPO 的 RLHF 训练加速了 1.8 倍至 2.8 倍,并将 GPU 利用率提高了 1.4 倍至 2.1 倍,且不影响训练收敛性。
引用
@article{arxiv.2509.25762,
title = {OPPO: Accelerating PPO-based RLHF via Pipeline Overlap},
author = {Kaizhuo Yan and Yingjie Yu and Yifan Yu and Haizhong Zheng and Fan Lai},
journal= {arXiv preprint arXiv:2509.25762},
year = {2026}
}