中文

分布式非凸优化中通信高效动量 SGD 的线性加速分析

最优化与控制 2019-05-13 v1 机器学习

摘要

近期大规模分布式机器学习应用(如深度神经网络)的发展极大受益于分布式非凸优化技术(如分布式随机梯度下降(SGD))的进步。一系列近期工作研究了具有降低通信量的分布式 SGD 变体的线性加速性质。线性加速性质使我们能够通过向系统添加更多计算节点来扩展计算能力。降低的通信复杂度是理想的,因为通信开销常是分布式系统中的性能瓶颈。近来,动量方法在训练机器学习模型中越来越被广泛采用,且常能更快收敛并具更好泛化性。例如,许多实践者使用带动量的分布式 SGD 以大数据训练深度神经网络。然而,是否任何分布式动量 SGD 都拥有与分布式 SGD 相同的线性加速性质并具有降低的通信复杂度,仍不清楚。本文通过考虑一种分布式通信高效动量 SGD 方法并证明其线性加速性质,填补了这一空白。

关键词

引用

@article{arxiv.1905.03817,
  title  = {On the Linear Speedup Analysis of Communication Efficient Momentum SGD for Distributed Non-Convex Optimization},
  author = {Hao Yu and Rong Jin and Sen Yang},
  journal= {arXiv preprint arXiv:1905.03817},
  year   = {2019}
}

备注

A short version of this paper is accepted to ICML 2019