方差缩减ProxSkip:算法、理论及其在联邦学习中的应用
机器学习
2022-07-12 v1 分布式、并行与集群计算
最优化与控制
摘要
我们研究基于{\em局部训练(LT)}范式的分布式优化方法:通过在客户端上执行更丰富的局部基于梯度的训练再进行参数平均,从而实现通信效率。回顾该领域的进展,我们{\em识别出LT方法的5代}:1)启发式,2)齐次,3)次线性,4)线性,5)加速。由Mishchenko、Malinovsky、Stich和Richt\'{a}rik(2022)的ProxSkip方法及其分析所开创的第5代,其特征是首次从理论上确认LT是一种通信加速机制。受此近期进展启发,我们通过表明可利用{\em方差缩减}进一步增强第5代LT方法,从而对该代做出贡献。虽然此前所有LT方法的理论结果都完全忽略局部工作的代价,并纯粹以通信轮数来表述,但我们证明在局部计算足够昂贵的情形下,我们的方法在{\em总训练代价}上于理论与实践均显著快于最优方法ProxSkip。我们从理论上刻画了这一阈值,并以实验结果证实我们的理论预测。
引用
@article{arxiv.2207.04338,
title = {Variance Reduced ProxSkip: Algorithm, Theory and Application to Federated Learning},
author = {Grigory Malinovsky and Kai Yi and Peter Richtárik},
journal= {arXiv preprint arXiv:2207.04338},
year = {2022}
}
备注
38 pages, 2 algorithms, 4 theorems, 11 figures