GPU 集群上分布式 DNN 训练的网络性能优化:1.5 分钟完成 ImageNet/AlexNet 训练
分布式、并行与集群计算
2019-10-23 v3
摘要
缩短模型训练时间,扩展深度神经网络(DNN)训练规模十分重要。高通信开销是跨多 GPU 分布式 DNN 训练的主要性能瓶颈之一。我们的调研表明,流行的开源 DNN 系统在由 56 Gbps 网络连接的 64 块 GPU 上仅能达到 2.5 的加速比。为解决该问题,我们提出一种用于分布式 DNN 训练的通信后端 GradientFlow,并采用一组网络优化技术。首先,我们将基于环的全归约(ring-based allreduce)、混合精度训练与计算/通信重叠集成到 GradientFlow 中。其次,我们提出惰性全归约(lazy allreduce),通过将多个通信操作融合为单一操作来提升网络吞吐,并设计粗粒度稀疏通信,仅传输重要梯度块以降低网络流量。在 512 块 GPU 上训练 ImageNet/AlexNet 时,我们的方法实现了 410.2 的加速比,并在 1.5 分钟内完成 95 轮训练,优于现有方法。
引用
@article{arxiv.1902.06855,
title = {Optimizing Network Performance for Distributed DNN Training on GPU Clusters: ImageNet/AlexNet Training in 1.5 Minutes},
author = {Peng Sun and Wansen Feng and Ruobing Han and Shengen Yan and Yonggang Wen},
journal= {arXiv preprint arXiv:1902.06855},
year = {2019}
}