CommFuse:基于通信分解与融合隐藏尾部延迟的分布式大语言模型训练
机器学习
2026-05-11 v2 人工智能
计算机视觉与模式识别
分布式、并行与集群计算
摘要
大语言模型的规模快速增长,使得必须将计算工作负载划分到 GPU、TPU 和 NPU 等加速器上。然而,这些并行策略会产生 substantial 数据通信开销,显著阻碍计算效率。虽然 communication-computation overlap 作为一种有前景的方向,但现有基于数据分片的解决方案 suffer于尾部延迟。为克服这一限制,本研究引入一种新颖的 communication-computation overlap 技术,以消除最先进的分布式 LLM 训练方法中的尾部延迟。该技术旨在有效缓解 tensor parallelism 和 data parallelism 在分布式训练和推理中的通信瓶颈。具体而言,我们提出一种称为 CommFuse 的新方法,用分解的点对点 (P2P) 通信取代 reduce-scatter 和 all-gather 的常规集合操作,并调度分区计算以实现细粒度 overlap。该方法提供一种降低通信开销的精确算法,消除尾部延迟。此外,它提供一种兼容 data-parallel 训练和各种 tensor-level 并行策略(包括 TPSP 和 UP)的通用解决方案。实验评估表明,我们的方法持续实现更低的延迟、更高的 Model FLOPS Utilization (MFU),以及高吞吐量。
关键词
引用
@article{arxiv.2604.24013,
title = {CommFuse: Hiding Tail Latency via Communication Decomposition and Fusion for Distributed LLM Training},
author = {Rezaul Karim and Austin Wen and Wang Zongzuo and Weiwei Zhang and Yang Liu and Walid Ahmed},
journal= {arXiv preprint arXiv:2604.24013},
year = {2026}
}
备注
Slightly modified the title, and corresponding minor wording change in the content