Qsparse-local-SGD:结合量化、稀疏化与本地计算的分布式 SGD
机器学习
2019-11-05 v2 分布式、并行与集群计算
机器学习
最优化与控制
摘要
通信瓶颈已被确认为大规模学习模型分布式优化中的一个重要问题。最近,已提出了几种缓解此问题的方法,包括不同形式的梯度压缩或计算本地模型并迭代混合它们。在本文中,我们提出了 Qsparse-local-SGD 算法,该算法通过跟踪真实梯度与压缩梯度之间的差异,将激进的稀疏化与量化、本地计算以及误差补偿相结合。我们提出了 Qsparse-local-SGD 的同步和异步实现。我们分析了 Qsparse-local-SGD 在分布式环境下,针对光滑非凸和凸目标函数的收敛性。我们证明,对于许多重要的稀疏化和量化器类别,Qsparse-local-SGD 以与普通分布式 SGD 相同的速率收敛。我们使用 Qsparse-local-SGD 在 ImageNet 上训练 ResNet-50,并表明,在达到目标精度所需的传输比特数方面,它比现有最先进技术有显著节省。
引用
@article{arxiv.1906.02367,
title = {Qsparse-local-SGD: Distributed SGD with Quantization, Sparsification, and Local Computations},
author = {Debraj Basu and Deepesh Data and Can Karakus and Suhas Diggavi},
journal= {arXiv preprint arXiv:1906.02367},
year = {2019}
}
备注
50 pages; 8 figures; full version of a paper in NeurIPS 2019 with the same title