中文

线性收敛的误差补偿SGD

最优化与控制 2020-10-26 v1 机器学习

摘要

在本文中,我们提出了一种统一分析框架,用于分析具有任意压缩和延迟更新的分布式SGD变体。我们的框架足够通用,涵盖了量化SGD、误差补偿SGD(EC-SGD)和带延迟更新的SGD(D-SGD)的不同变体。通过一个单一定理,我们推导出了所有符合该框架方法的复杂度结果。对于已有方法,该定理给出了已知最佳的复杂度结果。此外,利用我们的通用方案,我们开发了结合方差缩减或任意采样与误差反馈及量化的SGD新变体,并推导了这些方法优于最先进结果的收敛速率。为说明我们框架的优势,我们开发了符合该框架的16种新方法。特别地,我们提出了首个称为EC-SGD-DIANA的方法,它基于误差反馈处理有偏压缩算子并对梯度差进行量化,我们证明了其收敛保证:当工人计算损失函数的全梯度时,EC-SGD-DIANA在恒定学习率下对凸和强凸目标均渐近以期望收敛到精确最优解。此外,对于工人的损失函数具有有限和形式的情况,我们改进了该方法来获得一种称为EC-LSVRG-DIANA的新方法,这是首个具有误差反馈和方差缩减、在恒定学习率下以期望渐近收敛到精确最优解的分布式随机方法。

关键词

引用

@article{arxiv.2010.12292,
  title  = {Linearly Converging Error Compensated SGD},
  author = {Eduard Gorbunov and Dmitry Kovalev and Dmitry Makarenko and Peter Richtárik},
  journal= {arXiv preprint arXiv:2010.12292},
  year   = {2020}
}

备注

NeurIPS 2020, 99 pages