中文

EF21:一种更新、更简单、理论上更优且实践中更快的误差反馈方法

机器学习 2021-06-10 v1 最优化与控制 机器学习

摘要

误差反馈(EF),也称为误差补偿,是在使用压缩通信机制(如 Top-kk)增强的有监督机器学习模型分布式训练背景下一种极为流行的收敛稳定机制。由 Seide 等人(2014)作为启发式方法首次提出后,EF 一直抗拒任何理论理解,直到最近 [Stich 等人, 2018, Alistarh 等人, 2018]。然而,所有现有分析要么 i) 仅适用于单节点设置,ii) 依赖于非常强且通常不合理的假设,例如梯度的全局有界性,或依赖于迭代相关的、无法先验检验且实践中可能不成立的假设,要么 iii) 通过引入额外的无偏压缩器来规避这些问题,而这增加了通信成本。在这项工作中,我们通过提出并分析一种我们称之为 EF21 的新 EF 机制,修正了所有这些缺陷,该机制在实践中持续且大幅优于 EF。我们的理论分析仅依赖标准假设,适用于分布式异构数据设置,并得出更好且更有意义的收敛速率。特别地,我们证明 EF21 对光滑非凸问题享有快速的 O(1/T)O(1/T) 收敛速率,击败了先前在梯度有界假设下展示的 O(1/T2/3)O(1/T^{2/3}) 界限。我们进一步将其改进为对 PL 函数的快速线性速率,这是 EF 类方法首个不依赖无偏压缩器的线性收敛结果。由于 EF 在大量应用中占据主导地位,我们相信我们的 2021 年变体 EF21 能对通信高效分布式学习的实践产生重大影响。

关键词

引用

@article{arxiv.2106.05203,
  title  = {EF21: A New, Simpler, Theoretically Better, and Practically Faster Error Feedback},
  author = {Peter Richtárik and Igor Sokolov and Ilyas Fatkhullin},
  journal= {arXiv preprint arXiv:2106.05203},
  year   = {2021}
}

备注

37 pages, 5 algorithms, 3 Theorems, 8 Lemmas, 15 Figures