中文

DASHA:具有通信压缩、最优预言机复杂度和无客户端同步的分布式非凸优化方法

机器学习 2022-05-24 v2

摘要

我们提出并分析了 DASHA:一类用于非凸分布式优化问题的新方法。当节点处的局部函数具有有限和或期望形式时,我们的新方法 DASHA-PAGE 与 DASHA-SYNC-MVR 改进了 Gorbunov 等人(2020)先前最先进方法 MARINA 的理论预言机与通信复杂度。具体而言,为达到一个 ε-驻点,并以随机稀疏化器 RandK 为例,我们的方法在有限和与期望形式下分别计算了最优梯度数 O(mεn)\mathcal{O}\left(\frac{\sqrt{m}}{\varepsilon\sqrt{n}}\right)O(σε3/2n)\mathcal{O}\left(\frac{\sigma}{\varepsilon^{3/2}n}\right),同时保持 SOTA 通信复杂度 O(dεn)\mathcal{O}\left(\frac{d}{\varepsilon \sqrt{n}}\right)。此外,与 MARINA 不同,新方法 DASHA、DASHA-PAGE 和 DASHA-MVR 仅发送压缩向量且从不同步节点,这使其在联邦学习中更为实用。我们将结果推广到函数满足 Polyak-Lojasiewicz 条件的情况。最后,我们的理论在实践中得到验证:在非凸分类与深度学习模型训练实验中均观察到显著改进。

关键词

引用

@article{arxiv.2202.01268,
  title  = {DASHA: Distributed Nonconvex Optimization with Communication Compression, Optimal Oracle Complexity, and No Client Synchronization},
  author = {Alexander Tyurin and Peter Richtárik},
  journal= {arXiv preprint arXiv:2202.01268},
  year   = {2022}
}