中文

TernGrad:用于减少分布式深度学习通信的三元梯度

机器学习 2018-01-01 v6 分布式、并行与集群计算 神经与进化计算

摘要

同步梯度和参数的高昂网络通信成本是分布式训练众所周知的瓶颈。在这项工作中,我们提出 TernGrad,使用三元梯度在数据并行中加速分布式深度学习。我们的方法仅需要三个数值级别 {-1,0,1},这可以大幅减少通信时间。我们在梯度有界的假设下从数学上证明了 TernGrad 的收敛性。在该界的指导下,我们提出逐层三元化与梯度裁剪以改善其收敛性。我们的实验表明,在 AlexNet 上应用 TernGrad 不会带来任何精度损失,甚至能提升精度。由 TernGrad 引起的 GoogLeNet 精度损失平均小于 2%。最后,我们提出一个性能模型来研究 TernGrad 的可扩展性。实验显示了针对不同深度神经网络的显著加速。我们的源代码已公开。

关键词

引用

@article{arxiv.1705.07878,
  title  = {TernGrad: Ternary Gradients to Reduce Communication in Distributed Deep Learning},
  author = {Wei Wen and Cong Xu and Feng Yan and Chunpeng Wu and Yandan Wang and Yiran Chen and Hai Li},
  journal= {arXiv preprint arXiv:1705.07878},
  year   = {2018}
}

备注

NIPS 2017 Oral