中文

M6-10T:一种用于高效多万亿参数预训练的共享-解耦范式

机器学习 2021-10-26 v3 计算与语言

摘要

近期深度学习算法、分布式训练乃至面向大模型硬件设计的快速发展,使得训练极端规模模型成为可能,例如拥有数百亿乃至数万亿参数的 GPT-3 与 Switch Transformer。然而,在有限资源下,需要海量计算与内存占用的极端规模模型训练在模型收敛上遭遇了令人沮丧的低效率。本文中,我们提出一种称为“伪到真(Pseudo-to-Real)”的简易训练策略,用于高内存占用需求的大模型。伪到真兼容具有顺序层架构的大模型。我们展示了在仅 512 块 GPU 上、10 天内预训练前所未有的 10 万亿参数模型(比最先进水平大一个数量级)的实践。除展示伪到真的应用外,我们还提供了一种技术——粒度化 CPU 卸载(Granular CPU offloading),以管理训练大模型的 CPU 内存并保持高 GPU 利用率。在适量资源上快速训练极端规模模型可带来小得多的碳足迹,并有助于更绿色的 AI。

关键词

引用

@article{arxiv.2110.03888,
  title  = {M6-10T: A Sharing-Delinking Paradigm for Efficient Multi-Trillion Parameter Pretraining},
  author = {Junyang Lin and An Yang and Jinze Bai and Chang Zhou and Le Jiang and Xianyan Jia and Ang Wang and Jie Zhang and Yong Li and Wei Lin and Jingren Zhou and Hongxia Yang},
  journal= {arXiv preprint arXiv:2110.03888},
  year   = {2021}
}

备注

14 pages, 4 figures