中文

非独立同分布数据上 FedAvg 的收敛性分析

机器学习 2020-06-26 v4 机器学习 最优化与控制

摘要

联邦学习使大量边缘计算设备能够在不共享数据的情况下联合学习一个模型。作为该设定下的主导算法,联邦平均(\texttt{FedAvg})在总设备的小子集上并行运行随机梯度下降(SGD),并仅偶尔对序列做一次平均。尽管简单,它在现实设定下缺乏理论保证。本文中我们分析 \texttt{FedAvg} 在非 iid 数据上的收敛性,并为强凸且光滑问题建立 O(1T)\mathcal{O}(\frac{1}{T}) 的收敛速率,其中 TT 为 SGD 次数。重要的是,我们的界展示了通信效率与收敛速率之间的权衡。由于用户设备可能与服务器断开,我们将全设备参与的假设放宽至部分设备参与,并研究不同平均方案;可在不严重拖慢学习的情况下实现低设备参与率。我们的结果表明数据异构性会减慢收敛,这与经验观测一致。此外,我们给出 \texttt{FedAvg} 在非 iid 数据上的必要条件:学习率 η\eta 必须衰减,即便使用全梯度亦然;否则解将偏离最优解 Ω(η)\Omega (\eta)

关键词

引用

@article{arxiv.1907.02189,
  title  = {On the Convergence of FedAvg on Non-IID Data},
  author = {Xiang Li and Kaixuan Huang and Wenhao Yang and Shusen Wang and Zhihua Zhang},
  journal= {arXiv preprint arXiv:1907.02189},
  year   = {2020}
}

备注

2020 International Conference on Learning Representations