MiCS:公有云上训练巨型模型的近线性扩展
分布式、并行与集群计算
2022-10-31 v5
摘要
现有的用于巨型模型训练(即具有数十亿参数的稠密模型)的通用框架,由于巨大的通信开销,在各种网络条件的云环境中无法高效扩展。本文中,我们提出 MiCS,其通过最小化通信规模(Minimizes the Communication Scale)来降低通信开销。具体而言,通过减少通信集合中的参与者数量,MiCS 可利用异构网络带宽,减少经较慢链路的网络流量,降低为维持高带宽利用率的通信延迟,并分摊昂贵的全局梯度同步开销。我们在 AWS 上的评估显示,MiCS 的系统吞吐量为最先进大模型训练系统的至多 2.89。MiCS 实现了近线性扩展效率,为 DeepSpeed 的至多 1.27。MiCS 使我们能在 512 块 GPU 上以 99.4% 的弱扩展效率训练一个拥有 1000 亿参数的专有模型,并且相较于 DGX-A100 集群,它能在 GPU 内存更少、网络更受限的公有云上饱和每块 GPU 超过 54.5% 的理论计算力。
引用
@article{arxiv.2205.00119,
title = {MiCS: Near-linear Scaling for Training Gigantic Model on Public Cloud},
author = {Zhen Zhang and Shuai Zheng and Yida Wang and Justin Chiu and George Karypis and Trishul Chilimbi and Mu Li and Xin Jin},
journal= {arXiv preprint arXiv:2205.00119},
year = {2022}
}