GradSkip:具有更优计算复杂度的通信加速局部梯度方法
机器学习
2025-06-11 v3 分布式、并行与集群计算
最优化与控制
机器学习
摘要
我们研究一类分布式优化算法,其通过允许客户端在通信前执行多次局部梯度类训练步骤以缓解高通信成本。在近期突破中,Mishchenko 等人(2022)证明,若执行得当,局部训练可带来可证明的通信加速,且在强凸情形下无需依赖任何数据相似性假设。然而,其 ProxSkip 方法要求所有客户端在每轮通信中执行相同次数的局部训练步骤。我们重新设计了 ProxSkip 方法,使拥有“较不重要”数据的客户端可用更少局部训练步骤而不影响方法的整体通信复杂度。具体而言,我们证明改进后的方法 GradSkip 在相同假设下线性收敛,且具有相同的加速通信复杂度,而局部梯度步数可相对局部条件数减少。我们进一步将方法推广:将概率交替的随机性扩展至任意无偏压缩算子,并考虑通用可近端正则化项。该推广(称为 GradSkip+)将文献中若干相关方法作为特例涵盖。最后,我们在精心设计的玩具问题上给出实证研究,证实了理论论断。
引用
@article{arxiv.2210.16402,
title = {GradSkip: Communication-Accelerated Local Gradient Methods with Better Computational Complexity},
author = {Artavazd Maranjyan and Mher Safaryan and Peter Richtárik},
journal= {arXiv preprint arXiv:2210.16402},
year = {2025}
}