中文

联邦优化中数据异构性的新理论视角

机器学习 2024-07-23 v1 分布式、并行与集群计算 信息论 math.IT 最优化与控制

摘要

在联邦学习 (FL) 中,数据异构性是现有理论分析对收敛率持悲观态度的主要原因。特别是对于许多联邦算法,当局部更新次数增大时,收敛率会显著增长,尤其是在梯度发散与局部Lipschitz常数乘积较大时。然而,实证研究表明,当这两个参数较大时,更多的局部更新仍然可以提高收敛率,这与理论发现相矛盾。本文旨在通过提供一种关于数据异构性的新视角来弥合理论理解与实际性能之间的差距。具体而言,我们提出了一种与局部Lipschitz梯度假设相比更弱的假设,即由异构性驱动的伪Lipschitz假设。我们表明,这一假设与梯度发散假设可以共同刻画数据异构性的影响。通过推导FedAvg及其扩展的收敛上界,我们显示,与现有工作相比,局部Lipschitz常数被替换为由异构性驱动的较小的伪Lipschitz常数,相应的收敛上界在相同局部更新次数下可显著降低,尽管其阶数不变。此外,当局部目标函数为二次函数时,可使用该异构性驱动的伪Lipschitz常数获得关于数据异构性影响的更多见解。例如,我们可以识别出FedAvg 在梯度发散可任意大的情形下仍能优于小批量SGD的区域。我们的发现通过实验得到了验证。

关键词

引用

@article{arxiv.2407.15567,
  title  = {A New Theoretical Perspective on Data Heterogeneity in Federated Optimization},
  author = {Jiayi Wang and Shiqiang Wang and Rong-Rong Chen and Mingyue Ji},
  journal= {arXiv preprint arXiv:2407.15567},
  year   = {2024}
}

备注

ICML 2024