中文

史诗节奏:通过 RhymeRL 加速 LLM 强化学习

机器学习 2025-08-27 v1 分布式、并行与集群计算

摘要

随着大型语言模型 (LLM) 的快速发展,强化学习 (RL) 已成为增强 LLM 推理能力的关键方法。不同于传统预训练方法,RL 涉及多个阶段:rollout、奖励和训练,这需要各种 worker 类型的协作。然而,当前的 RL 系统仍面临显著的 GPU 资源 underutilization,主要源于两个因素:(1) rollout 阶段占据整个 RL 流程的绝大部分时间 due to test-time scaling;(2) 同一 batch 中 rollout 长度的不平衡导致 GPU 泡沫。虽然已有异步执行和截断等解决方案只能部分缓解,但可能以牺牲训练准确性为代价来换取效率。我们的关键洞察源于一个被忽视的观察:rollout 响应在相邻训练时代之间 exhibits 显著相似性。基于此洞察,我们提出了 RhymeRL,一个旨在加速 RL 训练的 LLM RL 系统,具有两个关键创新。首先,为提高 rollout 生成效果,我们提出了 HistoSpec,一种利用历史 rollout token 序列相似性获取准确草稿的投机解码推理引擎。其次,为解决 rollout 泡沫问题,我们引入了 HistoPipe,一种利用历史 rollout 分布相似性在 rollout worker 之间平衡工作负载的两级调度策略。在真实的生产环境中评估表明,RhymeRL 能够实现从几十到数千个 GPU 的规模化。实验结果表明,RhymeRL 相对于现有方法实现了 2.6 倍的性能提升,且未牺牲准确性或修改 RL 范式。

关键词

引用

@article{arxiv.2508.18588,
  title  = {History Rhymes: Accelerating LLM Reinforcement Learning with RhymeRL},
  author = {Jingkai He and Tianjian Li and Erhu Feng and Dong Du and Qian Liu and Tao Liu and Yubin Xia and Haibo Chen},
  journal= {arXiv preprint arXiv:2508.18588},
  year   = {2025}
}