MG-WFBP:面向分布式同步 SGD 算法的高效数据通信
分布式、并行与集群计算
2018-12-04 v2
摘要
分布式同步随机梯度下降已被广泛用于在计算机集群上训练深度神经网络。随着计算能力的提升,网络通信已成为系统可扩展性的一个限制因素。在本文中,我们观察到许多深度神经网络具有大量层,但每层需通信的数据量很小。基于将若干短通信任务合并为单个任务可减少总体通信时间这一事实,我们构建了一个最小化训练迭代时间的优化问题。我们开发了名为合并梯度 WFBP(MG-WFBP)的最优解,并在我们的开源深度学习平台 B-Caffe 中予以实现。我们在具有 10GbE 互联的 8 节点 GPU 集群上的实验结果以及基于迹的 64 节点集群仿真结果均表明,MG-WFBP 算法可比现有方法 WFBP 和 SyncEASGD 实现更好的扩展效率。
引用
@article{arxiv.1811.11141,
title = {MG-WFBP: Efficient Data Communication for Distributed Synchronous SGD Algorithms},
author = {Shaohuai Shi and Xiaowen Chu and Bo Li},
journal= {arXiv preprint arXiv:1811.11141},
year = {2018}
}
备注
9 pages, INFOCOM 2019