RolloutPipe:分离式在策大语言模型强化学习中的流水线化滚动生成与训练重叠
分布式、并行与集群计算
2026-06-25 v1 机器学习
摘要
用于推理的大型语言模型(LLM)后训练日益依赖带可验证奖励的强化学习(RLVR),即模型从数学、逻辑和科学任务上的真实反馈中学习。为实现灵活的资源分配并支持异构训练设置,现代RLVR系统采用分离式架构,将滚动生成(rollout generation)与策略训练解耦到独立的GPU池中。然而,现有的同步在策GRPO(Group Relative Policy Optimization,组相对策略优化)RLVR系统在完成整个滚动生成后才开始训练,导致训练器GPU池在滚动生成进行期间处于空闲。异步RL流水线重叠这两个阶段,但代价是使用陈旧数据训练。为应对这些挑战,我们提出RolloutPipe,一种面向分离式RLVR系统的后训练框架,它将固定权重的滚动生成转变为完整组流水线,即可训练组在后续组仍在生成时即移交给训练器。RolloutPipe通过两项技术实现这一目标:完整组流水线化(CGP)和前沿组调度(FGD)。CGP在组实例化完成时即按FIFO将每个可训练完整组分派给训练器;FGD是滚动生成节点上的一种准入策略,优先接纳构成下一批训练所需的 frontiers 组请求,从而使训练就绪的组更早且更平稳地到达。该设计在滚动生成完成前即开始训练,同时保持了在策正确性。在Qwen3-1.7B上跨四个推理与科学基准及十二种滚动生成设置进行评估,与最先进的滚动生成与训练系统Slime相比,RolloutPipe将滚动到训练结束时间缩短了30.7%–42.3%,并将训练器等待比例降低了37%–76%。
引用
@article{arxiv.2606.26997,
title = {RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning},
author = {Rongjian Chen and Jianmin Hu and Kejiang Ye and Minxian Xu},
journal= {arXiv preprint arXiv:2606.26997},
year = {2026}
}
备注
15 pages