中文

具有掉队者的高效 AllReduce

机器学习 2025-09-30 v2 分布式、并行与集群计算

摘要

分布式机器学习工作负载使用数据并行和张量并行进行训练和推理,两者都依赖 AllReduce 集体通信来同步梯度或激活值。然而,AllReduce 算法在到达集体通信之前的同步屏障时,会被最慢的 GPU(即掉队者)延迟。为了应对这一挑战,我们提出了 StragglAR:一种用于 AllReduce 的并行算法,通过利用 GPU 执行时间的自然差异来加速分布式训练和推理。StragglAR 在掉队者引起的延迟期间,在剩余的 GPU 之间执行 ReduceScatter,并在最后一个 GPU 到达同步屏障后执行一种新颖的集体通信算法来完成 AllReduce。对于大型 GPU 集群,StragglAR 在流行的带宽高效算法上实现了 2 倍的理论加速,通过利用 GPU 到达同步屏障时的不对称性,突破了带宽最优的同步 AllReduce 的下界。在 8-GPU 服务器上,StragglAR 比最先进的 AllReduce 算法提供了 25% 的加速。

关键词

引用

@article{arxiv.2505.23523,
  title  = {Efficient AllReduce with Stragglers},
  author = {Arjun Devraj and Eric Ding and Abhishek Vijaya Kumar and Robert Kleinberg and Rachee Singh},
  journal= {arXiv preprint arXiv:2505.23523},
  year   = {2025}
}

备注

27 pages, 13 figures