中文

ZeRO++: 面向巨型模型训练的极高效集合通信

分布式、并行与集群计算 2023-06-21 v1 人工智能 机器学习 性能

摘要

零冗余优化器(ZeRO)因其易用性、高效性与良好的可扩展性,已被用于在大规模 GPU 集群上训练多种大语言模型。然而,当在低带宽集群上训练,或规模化迫使每 GPU 批大小较小时,ZeRO 的有效吞吐受限于前向传播、反向传播中收集权重以及梯度平均所产生的高通信量。本文引入三种通信量削减技术,我们统称为 ZeRO++,分别针对 ZeRO 中的各个通信集合操作。其一是基于块量化的 all-gather。其二是以通信换取更多内存的数据重映射。其三是新颖的基于 all-to-all 的量化梯度平均范式,以替代 reduce-scatter 集合操作,尽管通信低精度数据仍保持精度。总体上,ZeRO++ 将 ZeRO 的通信量降低 4 倍,在 384 GPU 规模下实现最高 2.16 倍的更优吞吐。

关键词

引用

@article{arxiv.2306.10209,
  title  = {ZeRO++: Extremely Efficient Collective Communication for Giant Model Training},
  author = {Guanhua Wang and Heyang Qin and Sam Ade Jacobs and Connor Holmes and Samyam Rajbhandari and Olatunji Ruwase and Feng Yan and Lei Yang and Yuxiong He},
  journal= {arXiv preprint arXiv:2306.10209},
  year   = {2023}
}

备注

12 pages