中文

Varuna:大规模深度学习模型的可扩展、低成本训练系统

分布式、并行与集群计算 2021-11-16 v2

摘要

当今训练大规模深度学习模型(数十亿参数)的系统假设并要求专用的“超集群”:数百或数千个 GPU 通过 NV-Link 和 Infiniband 等专用高带宽互连连接。除了昂贵之外,这种对超集群和定制高速互连的依赖限制了此类集群的规模,造成(a)作业并行性的可扩展性限制;(b)超集群间的资源碎片。在本文中,我们提出 Varuna,一种新系统,可在商用网络上训练大规模深度学习模型。Varuna 节约使用网络资源,并自动配置用户的训练作业以高效利用任意给定资源集。因此,Varuna 能够利用成本低约 5 倍的“低优先级”虚拟机,从而显著降低大规模模型训练成本。我们通过在便宜 5 倍的“spot VM”上训练大规模模型(包括一个 2000 亿参数模型)同时保持高训练吞吐量,展示了 Varuna 的有效性。与其他模型并行方法相比,Varuna 将端到端训练时间最多缩短 18 倍,与其他流水线并行方法相比最多缩短 26%。Varuna 的代码可在 https://github.com/microsoft/varuna 获取。

关键词

引用

@article{arxiv.2111.04007,
  title  = {Varuna: Scalable, Low-cost Training of Massive Deep Learning Models},
  author = {Sanjith Athlur and Nitika Saran and Muthian Sivathanu and Ramachandran Ramjee and Nipun Kwatra},
  journal= {arXiv preprint arXiv:2111.04007},
  year   = {2021}
}

备注

14 pages, 10 figures