中文

基于记忆的分布式 SGD 的收敛性

机器学习 2019-05-31 v1 机器学习

摘要

分布式随机梯度下降~(DSGD) 已被广泛用于优化大规模机器学习模型,包括凸与非凸模型。随着模型规模的快速增长,巨大的通信成本已成为传统 DSGD 的瓶颈。近来已提出许多通信压缩方法。基于记忆的分布式随机梯度下降~(M-DSGD) 是高效方法之一,因每个工作节点在每次迭代中仅通信一个稀疏向量,从而通信成本很小。近期工作给出了采用朴素 SGD 时 M-DSGD 的收敛速率。然而,当 M-DSGD 采用动量 SGD 时,仍缺乏收敛理论。本文中,我们通过引入变换方程提出了 M-DSGD 的通用收敛分析。该变换方程描述了传统 DSGD 与 M-DSGD 之间的关系,从而可将 M-DSGD 转化为其对应的 DSGD。由此我们得到了动量 M-DSGD 在凸与非凸问题下的收敛速率。此外,我们将 M-DSGD 与阶段式学习相结合,使 M-DSGD 在各阶段的学习率为常数并随阶段而非迭代递减。利用变换方程,我们给出了阶段式 M-DSGD 的收敛速率,弥合了理论与实践的鸿沟。

关键词

引用

@article{arxiv.1905.12960,
  title  = {On the Convergence of Memory-Based Distributed SGD},
  author = {Shen-Yi Zhao and Hao Gao and Wu-Jun Li},
  journal= {arXiv preprint arXiv:1905.12960},
  year   = {2019}
}