中文

MG-WFBP:分布式深度学习中明智合并梯度以实现高效通信

分布式、并行与集群计算 2021-01-19 v2 机器学习

摘要

分布式同步随机梯度下降已广泛用于在计算机集群上训练深度神经网络(DNNs)。随着计算能力的提升,网络通信通常限制了系统的可扩展性。无等待反向传播(WFBP)是一种在训练过程中重叠通信与计算的流行方案。本文中,我们观察到许多DNNs具有大量层,且每层在分布式训练中仅需通信少量数据,这可能使WFBP效率低下。基于将若干短通信任务合并为单个任务可减少总体通信时间这一事实,我们形式化了一个优化问题以最小化流水线通信与计算中的训练时间。我们推导出一种不影响训练性能且可高效求解的最优解。随后我们将该解应用于提出一种名为合并梯度WFBP(MG-WFBP)的分布式训练算法,并在Caffe和PyTorch两个平台上实现。我们在三个GPU集群上进行了大量实验以验证MG-WFBP的有效性。我们进一步利用基于轨迹的4至2048个GPU的仿真来探索MG-WFBP的潜在扩展效率。实验结果表明,MG-WFBP比现有方法取得了更好的扩展性能。

关键词

引用

@article{arxiv.1912.09268,
  title  = {MG-WFBP: Merging Gradients Wisely for Efficient Communication in Distributed Deep Learning},
  author = {Shaohuai Shi and Xiaowen Chu and Bo Li},
  journal= {arXiv preprint arXiv:1912.09268},
  year   = {2021}
}

备注

Accepted by IEEE TPDS. 15 pages. arXiv admin note: substantial text overlap with arXiv:1811.11141