稀疏RL同步:实现约100倍的通信量减少的无损权重同步
机器学习
2026-05-11 v1 人工智能
分布式、并行与集群计算
摘要
在大规模强化学习(RL)系统中进行解耦的Trainer-Rollout执行时,Trainer必须定期同步策略权重到Rollout端,以限制策略的陈旧性。当节点间带宽充足时,此类同步通常仅占端到端成本的一个小比例。随着模型规模的增大,通信需求会迅速上升。然而,在带宽受限或网络波动的部署中——例如跨数据中心或跨集群环境、异构资源池以及在线RL——权重同步可能成为吞吐量和尾部延迟的主要瓶颈。我们观察到,在主流的大型模型RL训练中,参数实际发生变化的地方在元素级别上高度稀疏(通常稀疏性超过99%)。基于这一观察,我们提出并实现了SparseRL-Sync,该方法用无损的稀疏更新负载(索引和值)取代完整的权重传输,这些负载可以在推理端进行精确重建,从而保持100%的保真度。在简化的成本模型下,稀疏同步将每个更新的通信量从S降低到约S/X;当稀疏性达到99%(X约为100)时,这相当于传输数据的约100倍降低。结合合适的分桶策略,SparseRL-Sync还减少了启动和控制平面开销,在带宽受限和高度异步的RL设置中显著提高了可扩展性和端到端效率。
引用
@article{arxiv.2605.07330,
title = {SparseRL-Sync: Lossless Weight Synchronization with ~100x Less Communication},
author = {Lucas Hu and Ranchi Zhao and Isaac Zhu and Zach Zhang and Hscos Zhang and Hugh Yin and Jason Zhao},
journal= {arXiv preprint arXiv:2605.07330},
year = {2026}
}
备注
Code will be released at https://github.com/scitix/helix