中文

去中心化和联邦优化中动量的极限

机器学习 2025-11-26 v1 人工智能

摘要

最近的研究探索了在局部方法中使用动量来增强分布式 SGD。这在联邦学习(FL)中尤为吸引人,因为动量直观上似乎是缓解统计异构性的解决方案。尽管近期在此方向取得了进展,但仍不清楚动量在去中心化场景下(即每次迭代只有部分 worker 参与)是否可以保证在统计异构性无界时收敛。在本文中,我们分析了在循环客户端参与下使用动量的情况,并理论证明它不可避免地受到统计异构性的影响。类似于 SGD,我们证明减小步长并无助于解决该问题:实际上,任何比 Θ(1/t)\Theta\left(1/t\right) 更快衰减的 schedule 都会导致收敛到一个常数值,该值取决于初始化和异构性界限。数值结果支持了该理论,深度学习实验确认了其在现实场景中的重要性。

关键词

引用

@article{arxiv.2511.20168,
  title  = {On the Limits of Momentum in Decentralized and Federated Optimization},
  author = {Riccardo Zaccone and Sai Praneeth Karimireddy and Carlo Masone},
  journal= {arXiv preprint arXiv:2511.20168},
  year   = {2025}
}

备注

Accepted at the 17th Workshop on Optimization for Machine Learning (OPT@NeurIPS2025)