基于拓扑感知通信对齐在超过9600个GPU上高效预训练LLM
分布式、并行与集群计算
2025-09-22 v1
摘要
大型语言模型(LLM)的缩放定律表明,通向机器智能的道路需要进行大规模训练。因此,各公司不断构建大规模GPU集群,并启动跨越数千个计算节点的训练任务。然而,由于LLM预训练具有复杂的通信模式,其中GPU在特定组内以稀疏但高容量的突发方式交换数据,这带来了独特的挑战。低效的资源调度会加剧带宽争用,导致训练性能次优。本文提出Arnold,一个总结我们经验的调度系统,旨在将LLM通信模式与大规模数据中心拓扑有效对齐。我们进行了深入的特征研究,以识别物理网络拓扑对LLM预训练任务的影响。基于这些洞察,我们开发了一种调度算法,以有效对齐现代数据中心中的通信模式与物理网络拓扑。通过模拟实验,我们展示了该算法在将通信组最大分布范围减少高达 x 方面的有效性。在生产训练中,当使用超过 个GPU进行训练时,我们的调度系统将端到端性能提升了 ,这对我们的训练流程是一个显著的改进。
引用
@article{arxiv.2509.15940,
title = {Efficient Pre-Training of LLMs via Topology-Aware Communication Alignment on More Than 9600 GPUs},
author = {Guoliang He and Youhe Jiang and Wencong Xiao and Kaihua Jiang and Shuguang Wang and Jun Wang and Zixian Du and Zhuo Jiang and Xinlei Zhang and Binhang Yuan and Eiko Yoneki},
journal= {arXiv preprint arXiv:2509.15940},
year = {2025}
}
备注
NeurIPS 2025