中文

ROSE:通过协作弹性在服务GPU上执行Rollout以支持智能体强化学习

分布式、并行与集群计算 2026-05-21 v2

摘要

智能体强化学习(RL)正在重塑LLM后训练,但端到端训练时间被计算密集型的多轮rollout所主导,这些rollout的资源需求在不同训练步骤间差异显著。资源固定的系统无法适应这种变化,而按需配置外部GPU的资源弹性方法则面临高分配开销和有限的可用性。我们观察到服务集群留有大量空闲的GPU计算和内存资源,并提出协作弹性:将已部署的服务GPU与rollout工作负载共享,以提供按需的弹性容量。实现这一点并非易事,因为它必须在突发流量下保持服务SLO,同时最小化跨集群通信开销。我们提出了ROSE,一个为智能体RL后训练实现协作弹性的系统,包含三个组件:(1)一个SLO安全的协同服务执行器,将异构的服务模型和rollout模型共同部署在相同的GPU上,动态共享内存和计算,同时保持服务SLO;(2)一个跨集群权重传输引擎,利用分片感知路由和权重稀疏性实现快速同步;(3)一个弹性rollout调度器,在专用GPU和机会性服务GPU之间动态路由rollout。在多种模型规模和集群规模上的实验表明,与资源固定的基线相比,ROSE将端到端吞吐量提高了1.3至3.3倍,与资源弹性的基线相比,将rollout时间减少了1.2至1.5倍,且没有违反服务SLO。

关键词

引用

@article{arxiv.2605.06534,
  title  = {ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL},
  author = {Wei Gao and Yuheng Zhao and Dilxat Muhtar and Dakai An and Xuchun Shang and Tianyuan Wu and Lunxi Cao and Shaopan Xiong and Weixun Wang and Ju Huang and Teng Ma and Siran Yang and Jiamang Wang and Lin Qu and Bo Zheng and Wei Wang},
  journal= {arXiv preprint arXiv:2605.06534},
  year   = {2026}
}

备注

18 pages, 15 figures