中文

Domino:通过通用张量分片和重叠消除LLM训练中的通信

分布式、并行与集群计算 2024-09-24 v1 人工智能 机器学习

摘要

鉴于生成式AI的流行,大型语言模型(LLM)常常需要数百或数千个GPU进行并行化和加速训练过程。当在大规模上训练LLM时,通信开销变得尤为突出。为消除分布式LLM训练中的通信开销,我们提出了Domino,通过将单个batch训练的数据依赖性拆分为更小的独立片段,实现计算隐藏于通信之后。Domino对这些独立片段进行流水线化训练,并提供细粒度通信与计算重叠的通用策略。广泛结果表明,与Megatron-LM相比,Domino在Nvidia DGX-H100 GPU上实现了最高可达1.3倍的加速。

关键词

引用

@article{arxiv.2409.15241,
  title  = {Domino: Eliminating Communication in LLM Training via Generic Tensor Slicing and Overlapping},
  author = {Guanhua Wang and Chengming Zhang and Zheyu Shen and Ang Li and Olatunji Ruwase},
  journal= {arXiv preprint arXiv:2409.15241},
  year   = {2024}
}

备注

12 pages