重访 LocalSGD 与 SCAFFOLD:改进收敛率与缺失分析
最优化与控制
2025-02-25 v3 分布式、并行与集群计算
机器学习
摘要
LocalSGD 和 SCAFFOLD 是分布式随机优化中广泛使用的方法,已在机器学习、大规模数据处理和联邦学习中得到大量应用。然而,严格确立它们相对于更简单方法(如小批量 SGD, MbSGD)的理论优势一来已证明具有挑战性,因为现有分析往往依赖强假设、不切实际的前提或过于限制性的情景。在本工作中,我们在各种现有或较弱条件下重新审视 LocalSGD 和 SCAFFOLD 的收敛性,包括梯度相似性、Hessian 相似性、弱凸性以及 Hessian 的 Lipschitz 连续性。我们的分析表明:(i) 在不要求更强梯度相似性假设的情况下,LocalSGD 对弱凸函数的收敛速度快于 MbSGD;(ii) LocalSGD 从更高阶相似性和光滑性中受益显著;(iii) SCAFFOLD 在更广泛的非二次函数类上比 MbSGD 收敛更快。这些理论见解提供了更清晰的理解,阐明了 LocalSGD 和 SCAFFOLD 在何种条件下优于 MbSGD。
引用
@article{arxiv.2501.04443,
title = {Revisiting LocalSGD and SCAFFOLD: Improved Rates and Missing Analysis},
author = {Ruichen Luo and Sebastian U Stich and Samuel Horváth and Martin Takáč},
journal= {arXiv preprint arXiv:2501.04443},
year = {2025}
}