关于优化模型并行通信的研究
机器学习
2024-08-20 v2 分布式、并行与集群计算
摘要
我们研究了一种在大规模模型并行深度学习(DL)中新颖且重要的通信模式,我们将其称为跨网格重分片。当模型并行的两种范式——算子内并行和算子间并行——相结合以在大型集群上支持大模型时,就会出现这种模式。在跨网格重分片中,分片张量需要从源设备网格发送到目标设备网格,在该目标网格上,该张量可能以相同或不同的布局进行分布。我们将其形式化为一个多对多多播通信问题,并表明现有方法要么是次优的,要么无法泛化到由不同模型架构和并行策略导致的不同网络拓扑或张量布局。随后,我们提出两项贡献以解决跨网格重分片问题:一个高效的基于广播的通信系统,以及一个“重叠友好”的流水线调度。在微基准测试中,我们的整体系统在各种张量和网格布局下比现有系统高出多达10倍。在GPT-3和U-Transformer两个大模型的端到端训练中,我们分别将吞吐量提高了10%和50%。
引用
@article{arxiv.2211.05322,
title = {On Optimizing the Communication of Model Parallelism},
author = {Yonghao Zhuang and Hexu Zhao and Lianmin Zheng and Zhuohan Li and Eric P. Xing and Qirong Ho and Joseph E. Gonzalez and Ion Stoica and Hao Zhang},
journal= {arXiv preprint arXiv:2211.05322},
year = {2024}
}