中文

面向分布式深度学习的分层自适应梯度稀疏化方法及其收敛性保证

机器学习 2020-03-03 v4 分布式、并行与集群计算 机器学习

摘要

为减少大型深度神经网络(DNN)模型的漫长训练时间,通常在工作节点集群上使用分布式同步随机梯度下降(S-SGD)。然而,多工作节点带来的加速受限于通信开销。流水线化和梯度稀疏化这两种方法已分别被提出以缓解通信开销的影响。但梯度稀疏化方法只能在反向传播之后发起通信,因此错失了流水线化的机会。在本文中,我们提出一种名为 LAGS-SGD 的新分布式优化方法,它将 S-SGD 与一种新颖的分层自适应梯度稀疏化(LAGS)方案相结合。在 LAGS-SGD 中,每个工作节点从每一层独立地选取一小组“显著”梯度,其规模可自适应于该层的通信-计算比。LAGS-SGD 的分层特性开启了通信与计算重叠的机会,而其自适应特性使其能灵活控制通信时间。我们证明 LAGS-SGD 具有收敛性保证,并且在较弱的分析假设下具有与原始 S-SGD 同阶的收敛速率。我们进行了大量实验以验证该分析假设及 LAGS-SGD 的收敛性能。在 16-GPU 集群上的实验结果表明,LAGS-SGD 在不损失明显模型精度的前提下优于原始 S-SGD 和现有的稀疏化 S-SGD。

关键词

引用

@article{arxiv.1911.08727,
  title  = {Layer-wise Adaptive Gradient Sparsification for Distributed Deep Learning with Convergence Guarantees},
  author = {Shaohuai Shi and Zhenheng Tang and Qiang Wang and Kaiyong Zhao and Xiaowen Chu},
  journal= {arXiv preprint arXiv:1911.08727},
  year   = {2020}
}

备注

8 pages. To appear at ECAI 2020