中文

基于压缩梯度差的分布式学习

机器学习 2023-12-29 v3 最优化与控制 机器学习

摘要

训练大型机器学习模型需要分布式计算方法,其中模型更新的通信是瓶颈。为此,近来提出了若干基于更新压缩(例如稀疏化和/或量化)的方法,包括 QSGD (Alistarh et al., 2017)、TernGrad (Wen et al., 2017)、SignSGD (Bernstein et al., 2018) 和 DQGD (Khirirat et al., 2018)。然而,这些方法均无法学习梯度,导致它们在批处理模式下无法收敛到真正的最优解。本工作中我们提出一种新的分布式学习方法——DIANA——它通过压缩梯度差解决了这一问题。我们在强凸和非凸设定下进行了理论分析,表明我们的收敛速率优于现有速率。我们也提供了支持非光滑正则化器的理论,并研究了量化方案之间的差异。我们对块量化以及 2\ell_2\ell_{\infty} 量化之间差异的分析弥合了理论与实践的鸿沟。最后,通过将我们的分析技术应用于 TernGrad,我们建立了该方法的首个收敛速率。

关键词

引用

@article{arxiv.1901.09269,
  title  = {Distributed Learning with Compressed Gradient Differences},
  author = {Konstantin Mishchenko and Eduard Gorbunov and Martin Takáč and Peter Richtárik},
  journal= {arXiv preprint arXiv:1901.09269},
  year   = {2023}
}

备注

59 pages; Changes in V3: writing, presentation, and numerical experiments