ZeRO-Infinity:打破GPU内存墙以实现极致规模深度学习
分布式、并行与集群计算
2021-04-19 v1 人工智能
机器学习
性能
摘要
在过去三年中,最大的稠密深度学习模型规模增长了超过1000倍,达到数千亿参数,而GPU内存仅增长了5倍(16 GB到80 GB)。因此,模型规模的扩大主要依靠系统创新,使大模型能放入多个GPU的聚合GPU内存中。然而,我们正接近GPU内存墙。仅拟合一个万亿参数模型进行训练就需要800块NVIDIA V100 GPU,而此类集群对大多数数据科学家而言根本无法企及。此外,在该规模下训练模型需要复杂的并行技术组合,给数据科学家重构模型带来了沉重负担。本文中,我们提出ZeRO-Infinity,一种利用GPU、CPU和NVMe内存的新型异构系统技术,可在有限资源上实现前所未有的模型规模,且无需重构模型代码。同时,它实现了优异的训练吞吐量和可扩展性,不受有限的CPU或NVMe带宽制约。ZeRO-Infinity可在当前代GPU集群上拟合数十乃至数百万亿参数的模型进行训练。它可用于在单个NVIDIA DGX-2节点上微调万亿参数模型,使大模型更易获取。在训练吞吐量和可扩展性方面,它在512块NVIDIA V100 GPU上维持超过25 petaflops(峰值的40%),同时展现出超线性可扩展性。ZeRO-Infinity的开源实现可通过DeepSpeed获取,这是一个使分布式训练变得简单、高效且有效的深度学习优化库。
引用
@article{arxiv.2104.07857,
title = {ZeRO-Infinity: Breaking the GPU Memory Wall for Extreme Scale Deep Learning},
author = {Samyam Rajbhandari and Olatunji Ruwase and Jeff Rasley and Shaden Smith and Yuxiong He},
journal= {arXiv preprint arXiv:2104.07857},
year = {2021}
}