中文

具有客户端方差缩减的压缩联邦学习的更快收敛速率

机器学习 2023-09-26 v3 分布式、并行与集群计算 数据结构与算法 最优化与控制

摘要

由于分布式与联邦学习应用中的通信瓶颈,使用通信压缩的算法引起了极大关注并广泛应用于实践。此外,客户端数量庞大、异质性高以及可用性有限导致了较高的客户端方差。本文通过提出压缩且客户端方差缩减的方法 COFIG 和 FRECON,共同解决这两个问题。我们在非凸设定下证明了 COFIG 通信轮数界的 O((1+ω)3/2NSϵ2+(1+ω)N2/3Sϵ2)O(\frac{(1+\omega)^{3/2}\sqrt{N}}{S\epsilon^2}+\frac{(1+\omega)N^{2/3}}{S\epsilon^2}),其中 NN 为客户端总数,SS 为每轮参与的客户端数,ϵ\epsilon 为收敛误差,ω\omega 为与压缩算子相关的方差参数。对于 FRECON,我们证明了其通信轮数界为 O((1+ω)NSϵ2)O(\frac{(1+\omega)\sqrt{N}}{S\epsilon^2})。在凸设定下,COFIG 在 O((1+ω)NSϵ)O(\frac{(1+\omega)\sqrt{N}}{S\epsilon}) 通信轮内收敛,据我们所知,这也是对每轮不与所有客户端通信的压缩方案的首次收敛结果。我们强调,COFIG 与 FRECON 均无需与所有客户端通信,并且在所考虑的机制下享有凸与非凸联邦学习的首次或更快收敛结果。实验结果指出 COFIG 和 FRECON 相对于现有基线具有经验优越性。

关键词

引用

@article{arxiv.2112.13097,
  title  = {Faster Rates for Compressed Federated Learning with Client-Variance Reduction},
  author = {Haoyu Zhao and Konstantin Burlachenko and Zhize Li and Peter Richtárik},
  journal= {arXiv preprint arXiv:2112.13097},
  year   = {2023}
}

备注

Accepted by SIAM Journal on Mathematics of Data Science (SIMODS)