大规模且高性能的深度学习集合通信
分布式、并行与集群计算
2026-03-17 v2 人工智能
机器学习
摘要
集合通信在数据中心和超级计算机工作负载中正变得越来越重要,随着分布式 AI 相关任务的增加。然而,现有的提供集合通信支持的库,如 NCCL、RCCL 和 Cray-MPICH,在现代 GPU 超级计算机上表现出若干性能和可扩展性限制。为应对这些挑战,我们引入了 Performant Collective Communication Library (PCCL),专为分布式深度学习 (DL) 工作负载设计。PCCL 提供了针对分布式 DL 中关键集合通信操作(all-gather、reduce-scatter 和 all-reduce)的高度优化实现。PCCL 采用分层设计,利用基于学习的自适应算法选择机制,以有效扩展到数千个 GPU。在 Frontier 的 2048 个 GCD 上,PCCL 对 RCCL 实现了显著的性能加速:reduce-scatter 最高达 168 倍,all-gather 最高达 33 倍,all-reduce 最高达 10 倍。在 Perlmutter 上,对 NCCL 的提升也保持在 5.7 倍左右。这些收益直接转化为生产级 DL 工作负载的性能提升:在 DeepSpeed ZeRO-3 训练中对 RCCL 实现了最高 4.9 倍的加速,在 DDP 训练中实现了最高 2.4 倍的加速。
关键词
引用
@article{arxiv.2504.18658,
title = {The Big Send-off: Scalable and Performant Collectives for Deep Learning},
author = {Siddharth Singh and Keshav Pradeep and Mahua Singh and Cunyang Wei and Abhinav Bhatele},
journal= {arXiv preprint arXiv:2504.18658},
year = {2026}
}