中文

加速随机额外梯度法:结合 Hessian 相似性与梯度相似性以减少分布式与联邦学习中的通信

最优化与控制 2024-12-03 v1 机器学习

摘要

现代学习的现实与趋势要求模型具备越来越强的泛化能力,这导致模型规模和训练样本量均不断增加。在单设备模式下已经难以解决此类任务。这就是分布式与联邦学习方法日益普及的原因。分布式计算涉及设备间的通信,需要解决两个关键问题:效率与隐私。应对通信开销最著名的方法之一是利用本地数据的相似性。文献中已分别对 Hessian 相似性和同质梯度进行了研究,但二者是分开探讨的。本文将这两种假设结合起来,分析了一种融合数据相似性利用与客户端采样思想的新方法。此外,为应对隐私问题,我们应用了额外噪声技术,并分析了其对所提方法收敛性的影响。相关理论通过在真实数据集上的训练得到了验证。

关键词

引用

@article{arxiv.2409.14280,
  title  = {Accelerated Stochastic ExtraGradient: Mixing Hessian and Gradient Similarity to Reduce Communication in Distributed and Federated Learning},
  author = {Dmitry Bylinkin and Kirill Degtyarev and Aleksandr Beznosikov},
  journal= {arXiv preprint arXiv:2409.14280},
  year   = {2024}
}

备注

25 pages, 15 figures, 4 appendices