中文

误差反馈重探:从平滑常数的二次均值到算术均值

机器学习 2024-02-19 v1 人工智能 最优化与控制 机器学习

摘要

误差反馈(Error Feedback, EF)是一种极为流行且高效的机制,用于修复分布式训练方法(如分布式 GD 或 SGD)在结合贪婪通信压缩技术(如 TopK)时出现的收敛问题。尽管 EF 早在近十年前就被提出(Seide et al., 2014),且社区已集中精力推进对该机制的理论理解,但仍有许多值得探索之处。在本文中,我们研究了一种名为 EF21 的现代误差反馈形式(Richtarik et al., 2021),它在最弱的假设下提供了目前已知最佳的理论保证,并且在实践中表现良好。具体而言,虽然 EF21 的理论通信复杂度依赖于某些平滑参数的二次均值,我们将这种依赖关系改进为它们的算术均值,后者总是更小,且在数据异构 regimes 中可能显著更小。我们带领读者回顾我们的发现过程:从将 EF21 应用于底层问题的等价重构(不幸的是,这需要通常不切实际的机器克隆)开始,接着发现了一种新的加权版 EF21(幸运的是,它无需任何克隆即可执行),最后回归到对原始 EF21 方法的改进分析。虽然这一进展适用于最简单的 EF21 形式,但我们的方法自然地扩展到了涉及随机梯度和部分参与的更复杂变体。此外,我们的技术改进了 EF21 在稀有特征 regime 下的最先进理论(Richtarik et al., 2023)。最后,我们通过适当的实验验证了我们的理论发现。

关键词

引用

@article{arxiv.2402.10774,
  title  = {Error Feedback Reloaded: From Quadratic to Arithmetic Mean of Smoothness Constants},
  author = {Peter Richtárik and Elnur Gasanov and Konstantin Burlachenko},
  journal= {arXiv preprint arXiv:2402.10774},
  year   = {2024}
}

备注

70 pages, 14 figures, 6 tables