中文

揭秘分布式Transformer模型的通信特征

分布式、并行与集群计算 2024-08-20 v1 人工智能

摘要

基于Transformer架构的深度学习模型已经彻底改变了许多深度学习应用,如大语言模型(LLMs)、视觉Transformer、音频生成和时间序列预测。这些进展的很大一部分得益于分布式训练,但分布式通信仍然是训练进展的重大瓶颈。本文研究了Transformer模型的通信行为——即在多节点/多GPU深度学习训练中,不同的并行方案如何通信数据。我们以GPT-based语言模型作为Transformer架构的案例研究,因为其普遍性。我们使用分析模型验证了从通信日志中获得的经验结果。在高层次上,我们的分析揭示了进一步优化小消息点对点通信的需求、序列长度、每GPU吞吐量、模型大小和所用优化之间的关联,以及在框架和HPC中间件设计和优化中潜在指导进一步优化的方向。

关键词

引用

@article{arxiv.2408.10197,
  title  = {Demystifying the Communication Characteristics for Distributed Transformer Models},
  author = {Quentin Anthony and Benjamin Michalowicz and Jacob Hatef and Lang Xu and Mustafa Abduljabbar and Aamir Shafi and Hari Subramoni and Dhabaleswar Panda},
  journal= {arXiv preprint arXiv:2408.10197},
  year   = {2024}
}