中文

通过全局与局部动量加速非凸联邦学习

机器学习 2021-10-26 v4 分布式、并行与集群计算 机器学习 最优化与控制

摘要

我们提出了 \texttt{FedGLOMO},一种新颖的联邦学习(FL)算法。在任意客户端异质性和压缩通信的条件下,对于平滑非凸函数,该算法收敛至 ϵ\epsilon-平稳点(即 E[f(x)2]ϵ\mathbb{E}[\|\nabla f(\bm{x})\|^2] \leq \epsilon)的迭代复杂度为 O(ϵ1.5)\mathcal{O}(\epsilon^{-1.5}),而大多数先前工作的复杂度为 O(ϵ2)\mathcal{O}(\epsilon^{-2})。使我们能够实现这种改进复杂度的关键算法思想基于以下观察:FL 中的收敛受到两个高方差来源的阻碍:具有多次局部更新的全局服务器聚合步骤(因客户端异质性而加剧),以及局部客户端级随机梯度的噪声。通过将服务器聚合步骤建模为广义梯度型更新,我们提出了一种在服务器端基于减方差动量的全局更新,当其与客户端的减方差局部更新结合使用时,使 \texttt{FedGLOMO} 能够享有更快的收敛速率。此外,我们在一种新颖且更现实的客户端异质性假设下推导了我们的结果,并进行了实证验证——这与先前难以验证的假设不同。我们的实验说明了 \texttt{FedGLOMO} 内在的方差减小效应,该效应在异质数据分布设置中隐式地抑制了客户端漂移,并提升了通信效率。

关键词

引用

@article{arxiv.2012.04061,
  title  = {Faster Non-Convex Federated Learning via Global and Local Momentum},
  author = {Rudrajit Das and Anish Acharya and Abolfazl Hashemi and Sujay Sanghavi and Inderjit S. Dhillon and Ufuk Topcu},
  journal= {arXiv preprint arXiv:2012.04061},
  year   = {2021}
}