中文

具有随机重排与梯度压缩的联邦优化算法

机器学习 2022-11-04 v2 最优化与控制

摘要

梯度压缩是改善机器学习模型分布式训练中随机一阶方法通信复杂度的常用技术。然而,现有工作仅考虑了有放回采样随机梯度。相反,实践中众所周知且近期理论上已证实,基于无放回采样的随机方法(例如随机重排(RR)方法)优于有放回采样梯度的方法。本工作填补了文献中的这一空白,首次给出了梯度压缩与无放回采样方法的分析。我们首先开发了随机重排与梯度压缩的朴素结合(Q-RR)。或许令人惊讶,但Q-RR的理论分析并未显示出使用RR的任何益处。我们大量的数值实验证实了这一现象。这是由于额外的压缩方差所致。为揭示RR在带压缩的分布式学习中的真正优势,我们提出一种称为DIANA-RR的新方法,其降低了压缩方差,且相比现有有放回采样随机梯度的对应方法具有可证明更优的收敛速率。接下来,为更好契合联邦学习应用,我们引入局部计算,即提出并分析了Q-RR与DIANA-RR的变体——Q-NASTYA与DIANA-NASTYA,它们使用局部梯度步以及不同的局部与全局步长。最后,我们进行了若干数值实验以阐明我们的理论结果。

关键词

引用

@article{arxiv.2206.07021,
  title  = {Federated Optimization Algorithms with Random Reshuffling and Gradient Compression},
  author = {Abdurakhmon Sadiev and Grigory Malinovsky and Eduard Gorbunov and Igor Sokolov and Ahmed Khaled and Konstantin Burlachenko and Peter Richtárik},
  journal= {arXiv preprint arXiv:2206.07021},
  year   = {2022}
}

备注

66 pages, 6 figures. Changes in V2: the presentation of the results was changed, extra experiments were added. Code: https://github.com/IgorSokoloff/rr_with_compression_experiments_source_code