基于压缩梯度差的分布式学习
机器学习
2023-12-29 v3 最优化与控制
机器学习
摘要
训练大型机器学习模型需要分布式计算方法,其中模型更新的通信是瓶颈。为此,近来提出了若干基于更新压缩(例如稀疏化和/或量化)的方法,包括 QSGD (Alistarh et al., 2017)、TernGrad (Wen et al., 2017)、SignSGD (Bernstein et al., 2018) 和 DQGD (Khirirat et al., 2018)。然而,这些方法均无法学习梯度,导致它们在批处理模式下无法收敛到真正的最优解。本工作中我们提出一种新的分布式学习方法——DIANA——它通过压缩梯度差解决了这一问题。我们在强凸和非凸设定下进行了理论分析,表明我们的收敛速率优于现有速率。我们也提供了支持非光滑正则化器的理论,并研究了量化方案之间的差异。我们对块量化以及 与 量化之间差异的分析弥合了理论与实践的鸿沟。最后,通过将我们的分析技术应用于 TernGrad,我们建立了该方法的首个收敛速率。
引用
@article{arxiv.1901.09269,
title = {Distributed Learning with Compressed Gradient Differences},
author = {Konstantin Mishchenko and Eduard Gorbunov and Martin Takáč and Peter Richtárik},
journal= {arXiv preprint arXiv:1901.09269},
year = {2023}
}
备注
59 pages; Changes in V3: writing, presentation, and numerical experiments