理解与利用权重更新稀疏性实现通信高效分布式强化学习
机器学习
2026-05-20 v2
摘要
受带宽限制的分布式强化学习 (RL) 后训练大型语言模型的训练过程受到两个通道的制约:从训练者到推理工作者的权重同步,以及训练者之间或伪梯度的同步。我们发现,约 99% 的每步权重更新在标准训练和推理前向传递使用的 BF16 转换后均不可见。我们通过展示在典型 RL 后训练学习率下,Adam 更新常常低于局部 BF16 四舍五入阈值来解释这种稀疏性。我们将这一观察转化为一种称为计算可见稀疏化的算法原则:仅传输将改变下一前向传递的更新。PULSE (Precision-gated Updates for Low-precision Sparse Exchange) 将这一原则转化为两种通信算法:PULSESync 从训练者发送无损稀疏 BF16 权重补丁给推理工作者,PULSELoCo 对 DiLoCo 风格的 FP32 伪梯度同步进行稀疏化并采用误差反馈。在受带宽限制的普通网络上,PULSESync 在保持训练者权重位相同的情况下,将权重同步通信减少超过 100 倍。PULSELoCo 在四个模型上匹配 DiLoCo,同时相对于 DiLoCo 减少超过 17 倍的训练者间通信,相对于最大评估设置下的 DDP 减少超过 100 倍。
引用
@article{arxiv.2602.03839,
title = {Understanding and Exploiting Weight Update Sparsity for Communication-Efficient Distributed RL},
author = {Erfan Miahi and Eugene Belilovsky},
journal= {arXiv preprint arXiv:2602.03839},
year = {2026}
}
备注
40 pages, 19 figures, 14 tables