中文

带误差反馈的通信高效分布式分块动量SGD

机器学习 2019-10-29 v2 分布式、并行与集群计算 最优化与控制 机器学习

摘要

通信开销是阻碍分布式机器学习系统可扩展性的主要瓶颈。近来,利用梯度压缩提升分布式神经网络训练通信效率的兴趣激增。使用1-bit量化,带多数投票的signSGD实现了32倍通信成本削减。然而,其收敛性基于不切实际的假设,且实践中可能发散。本文提出一种带涅斯捷罗夫动量的通用分布式压缩SGD。我们考虑双向压缩,即压缩发往与来自工作节点的梯度。给出了针对通用梯度压缩器的非凸问题收敛性分析。通过将梯度划分为块,引入分块压缩器,使每个梯度块以1-bit格式配缩放因子压缩并传输,从而实现近32倍通信削减。实验结果表明,所提方法收敛速度与全精度分布式动量SGD相当,并达到相同测试精度。特别是在7个工作节点于ImageNet上的分布式ResNet训练中,所提算法使用全精度梯度的动量SGD达到相同测试精度,但墙钟时间减少46%46\%

关键词

引用

@article{arxiv.1905.10936,
  title  = {Communication-Efficient Distributed Blockwise Momentum SGD with Error-Feedback},
  author = {Shuai Zheng and Ziyue Huang and James T. Kwok},
  journal= {arXiv preprint arXiv:1905.10936},
  year   = {2019}
}

备注

NeurIPS 2019