中文

APRIL:强化学习中的主动部分 Rollout 以驯服长尾生成

机器学习 2025-09-30 v3 人工智能

摘要

强化学习 (RL) 已成为推进大规模预训练语言模型 (LLM) 的基石。包括 GPT-o 系列、DeepSeek-R1、Kimi-K1.5、Grok 4 和 GLM-4.5 在内的连续几代模型,都依赖大规模 RL 训练来增强推理和编码能力。为了满足社区日益增长的 RL 需求,人们提出了许多 RL 框架。然而,RL 训练在计算上仍然昂贵,其中 rollout 生成占总运行时间的 90% 以上。此外,其效率通常受到 rollout 响应长度的长尾分布的制约,少数冗长响应会阻塞整个批次,导致 GPU 空闲和利用不足。随着模型和 rollout 规模的持续增长,这一瓶颈日益限制可扩展性。为了应对这一挑战,我们提出了强化学习中的主动部分 Rollout (APRIL),以缓解长尾低效问题。在 rollout 阶段,APRIL 对 rollout 请求进行超额配置,一旦达到目标响应数量即终止,并回收不完整的响应以在未来的步骤中继续。该策略确保没有 rollout 被丢弃,同时大幅减少 GPU 空闲时间。实验表明,APRIL 在常用的 RL 算法 (GRPO, DAPO, GSPO) 中将 rollout 吞吐量平均提高 22.5%(最高 44%),加速了收敛,并在各项任务中实现了平均 2.1%(最高 8%)的最终准确率提升。此外,APRIL 与框架和硬件无关,已集成到 slime RL 框架中,并可在 NVIDIA 和 AMD GPU 上部署。总而言之,这项工作在提出 APRIL 时统一了系统级和算法级的考量,旨在推进 RL 训练效率并激发 RL 系统的进一步优化。我们的代码库可在 https://github.com/RLsys-Foundation/APRIL 获取

关键词

引用

@article{arxiv.2509.18521,
  title  = {APRIL: Active Partial Rollouts in Reinforcement Learning to Tame Long-tail Generation},
  author = {Yuzhen Zhou and Jiajun Li and Yusheng Su and Gowtham Ramesh and Zilin Zhu and Xiang Long and Chenyang Zhao and Jin Pan and Xiaodong Yu and Ze Wang and Kangrui Du and Jialian Wu and Ximeng Sun and Jiang Liu and Qiaolin Yu and Hao Chen and Zicheng Liu and Emad Barsoum},
  journal= {arXiv preprint arXiv:2509.18521},
  year   = {2025}
}