MARINA:基于压缩的更快速非凸分布式学习
机器学习
2022-01-11 v3 最优化与控制
摘要
我们提出并分析了 MARINA:一种面向异构数据集上非凸分布式学习的新型通信高效方法。MARINA 采用一种基于梯度差压缩的新型通信压缩策略,该策略让人联想到但不同于 Mishchenko 等人 (2019) 的 DIANA 方法所采用的策略。与几乎所有竞争的分布式一阶方法(包括 DIANA)不同,我们的方法基于精心设计的带偏梯度估计器,这是其卓越理论与实际性能的关键。我们为 MARINA 证明的通信复杂度界明显优于以往所有一阶方法。此外,我们提出并分析了 MARINA 的两个变体:VR-MARINA 和 PP-MARINA。第一种方法针对客户端拥有的局部损失函数为有限和或期望形式的情况而设计,第二种方法允许客户端部分参与——这是联邦学习中的一个重要特性。我们所有方法在预言机/通信复杂度方面均优于以往最先进(state-of-the-art)的方法。最后,我们对满足 Polyak-Lojasiewicz 条件的所有方法给出了收敛性分析。
引用
@article{arxiv.2102.07845,
title = {MARINA: Faster Non-Convex Distributed Learning with Compression},
author = {Eduard Gorbunov and Konstantin Burlachenko and Zhize Li and Peter Richtárik},
journal= {arXiv preprint arXiv:2102.07845},
year = {2022}
}
备注
ICML 2021; v2 contains additional experiments; v3 contains small fixes of the typos in the complexity results for online case for VR-MARINA; 42 pages, 6 figures, 3 algorithms