中文

论联邦学习中局部下降方法的收敛性

机器学习 2019-12-10 v2 分布式、并行与集群计算 机器学习

摘要

在联邦分布式学习中,目标是优化定义于分布式设备上的全局训练目标,其中各设备上的数据分片可能采样自不同分布(亦称异构或非独立同分布数据样本)。本文将最初为同构分布式优化设计的带周期平均的局部随机与全梯度下降推广,用以求解联邦学习中的非凸优化问题。尽管关于局部 SGD 在同构设定下减少通信轮数有效性的研究甚少,但其在异构设定下的收敛性与通信复杂度多凭经验验证,缺乏充分的理论理解。为弥补此缺口,我们证明:通过恰当分析联邦设定中无偏梯度与采样机制的影响,在温和假设下,局部分布式方法隐式的方差缩减特性可推广至异构数据分片,并在一般非凸及{\pl}条件(强凸性的推广)下展现出同构设定中已知最优的收敛速率。我们的理论结果补充了近期证明局部 GD/SGD 适用于联邦学习的实证研究。我们还将所提局部方法专用于网络化分布式优化。据我们所知,所得收敛速率是迄今关于带周期平均的局部下降方法在集中式与网络化分布式优化中求解非凸联邦优化收敛问题的最尖锐结果。

关键词

引用

@article{arxiv.1910.14425,
  title  = {On the Convergence of Local Descent Methods in Federated Learning},
  author = {Farzin Haddadpour and Mehrdad Mahdavi},
  journal= {arXiv preprint arXiv:1910.14425},
  year   = {2019}
}

备注

47 pages, "Updates from v1: A technical error in Lemma B3 is corrected"