Laminar:面向大规模异步强化学习后训练框架
机器学习
2025-10-15 v1 人工智能
分布式、并行与集群计算
摘要
强化学习(RL)后训练用于大型语言模型(LLM),如今正在大型集群上扩展并运行较长时间以提升模型推理性能。然而,现有 RL 框架的可扩展性受限,因为 RL 轨迹生成中存在极端长尾偏斜,导致 GPU 利用率严重不足。当前的异步 RL 系统试图缓解此问题,但它们依赖于演员与所有 rollout 之间的全局权重同步,形成僵化的模型更新计划。这种全局同步不适用于 RL 训练中高度偏斜且不断演化的轨迹生成延迟分布,严重影响训练效率。我们的关键洞察是,高效扩展需要通过轨迹级异步化来打破这种锁定机制,这会生成和消费每个轨迹。我们提出 Laminar,一个可扩展且稳健的 RL 后训练系统,基于完全解耦的架构。首先,我们用一组中继工作者取代全局更新,作为分布式参数服务。这实现了异步和细粒度的权重同步,允许 rollout 在不阻塞演员训练循环的情况下随时拉取最新权重。其次,动态重包机制将长尾轨迹整合到少数专用 rollout 上,以最大化生成吞吐量。完全解耦的设计还隔离了故障,确保长时间运行任务的稳健性。在 1024 GPU 集群上的评估显示,Laminar 相比最先进的系统实现了最高可达 5.48 倍的训练吞吐量提升,同时缩短模型收敛时间。
引用
@article{arxiv.2510.12633,
title = {Laminar: A Scalable Asynchronous RL Post-Training Framework},
author = {Guangming Sheng and Yuxuan Tong and Borui Wan and Wang Zhang and Chaobo Jia and Xibin Wu and Yuqi Wu and Xiang Li and Chi Zhang and Yanghua Peng and Haibin Lin and Xin Liu and Chuan Wu},
journal= {arXiv preprint arXiv:2510.12633},
year = {2025}
}