使用 DeepSpeed 与 Megatron 训练 Megatron-Turing NLG 530B:一个大规模生成式语言模型
计算与语言
2022-02-07 v3
摘要
预训练通用语言模型可通过零样本、少样本和微调技术适配下游任务,从而在各类自然语言处理领域取得最先进的准确率。由于其成功,这些模型的规模迅速增大,需要高性能硬件、软件和算法技术来实现如此大规模模型的训练。作为微软与英伟达联合努力的成果,我们给出了基于单体 transformer 的最大语言模型 Megatron-Turing NLG 530B(MT-NLG,含 5300 亿参数)的训练细节。在本文中,我们首先聚焦于使用 DeepSpeed 和 Megatron 训练该模型的基础设施以及所采用的 3D 并行方法。接下来,我们详述训练过程、训练语料的设计以及数据整理技术,我们认为这是模型成功的关键要素。最后,我们讨论了各种评估结果,以及 MT-NLG 表现出的其他有趣观察与新特性。我们证明 MT-NLG 在若干 NLP 基准上实现了优越的零样本、单样本和少样本学习准确率,并确立了新的最先进结果。我们相信我们的贡献将有助于大规模训练基础设施、大规模语言模型与自然语言生成的发展。
引用
@article{arxiv.2201.11990,
title = {Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model},
author = {Shaden Smith and Mostofa Patwary and Brandon Norick and Patrick LeGresley and Samyam Rajbhandari and Jared Casper and Zhun Liu and Shrimai Prabhumoye and George Zerveas and Vijay Korthikanti and Elton Zhang and Rewon Child and Reza Yazdani Aminabadi and Julie Bernauer and Xia Song and Mohammad Shoeybi and Yuxiong He and Michael Houston and Saurabh Tiwary and Bryan Catanzaro},
journal= {arXiv preprint arXiv:2201.11990},
year = {2022}
}
备注
Shaden Smith and Mostofa Patwary contributed equally