中文

MegaScale:将大型语言模型训练扩展至超过 10,000 块 GPU

机器学习 2024-02-27 v1 分布式、并行与集群计算

摘要

我们介绍了 MegaScale 的设计、实现和工程经验,这是一个用于在超过 10,000 块 GPU 规模上训练大型语言模型 (LLMs) 的生产系统。在此规模上训练 LLMs 给训练效率和稳定性带来了前所未有的挑战。我们采用全栈方法,协同设计算法和系统组件,涵盖模型块和优化器设计、计算与通信重叠、算子优化、数据流水线以及网络性能调优。鉴于 LLM 训练任务的长期性,在整个训练过程中保持高效率(即稳定性)是生产环境中的重要考量。许多严重的稳定性问题仅在大规模下显现,而深入的观测能力是解决这些问题的关键。我们开发了一套诊断工具来监控栈深处的系统组件和事件,识别根本原因,并推导有效技术以实现容错和缓解落后者。MegaScale 在 12,288 块 GPU 上训练 175B LLM 模型时实现了 55.2% 的模型浮点运算利用率 (MFU),相比 Megatron-LM 将 MFU 提高了 1.34 倍。我们分享了识别和修复故障及落后者的操作经验。希望通过从系统角度阐述问题并分享我们的经验,这项工作能启发未来的 LLM 系统研究。

关键词

引用

@article{arxiv.2402.15627,
  title  = {MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs},
  author = {Ziheng Jiang and Haibin Lin and Yinmin Zhong and Qi Huang and Yangrui Chen and Zhi Zhang and Yanghua Peng and Xiang Li and Cong Xie and Shibiao Nong and Yulu Jia and Sun He and Hongmin Chen and Zhihao Bai and Qi Hou and Shipeng Yan and Ding Zhou and Yiyao Sheng and Zhuo Jiang and Haohan Xu and Haoran Wei and Zhang Zhang and Pengfei Nie and Leqi Zou and Sida Zhao and Liang Xiang and Zherui Liu and Zhe Li and Xiaoying Jia and Jianxi Ye and Xin Jin and Xin Liu},
  journal= {arXiv preprint arXiv:2402.15627},
  year   = {2024}
}