DASHA:具有通信压缩、最优预言机复杂度和无客户端同步的分布式非凸优化方法
机器学习
2022-05-24 v2
摘要
我们提出并分析了 DASHA:一类用于非凸分布式优化问题的新方法。当节点处的局部函数具有有限和或期望形式时,我们的新方法 DASHA-PAGE 与 DASHA-SYNC-MVR 改进了 Gorbunov 等人(2020)先前最先进方法 MARINA 的理论预言机与通信复杂度。具体而言,为达到一个 ε-驻点,并以随机稀疏化器 RandK 为例,我们的方法在有限和与期望形式下分别计算了最优梯度数 与 ,同时保持 SOTA 通信复杂度 。此外,与 MARINA 不同,新方法 DASHA、DASHA-PAGE 和 DASHA-MVR 仅发送压缩向量且从不同步节点,这使其在联邦学习中更为实用。我们将结果推广到函数满足 Polyak-Lojasiewicz 条件的情况。最后,我们的理论在实践中得到验证:在非凸分类与深度学习模型训练实验中均观察到显著改进。
引用
@article{arxiv.2202.01268,
title = {DASHA: Distributed Nonconvex Optimization with Communication Compression, Optimal Oracle Complexity, and No Client Synchronization},
author = {Alexander Tyurin and Peter Richtárik},
journal= {arXiv preprint arXiv:2202.01268},
year = {2022}
}