第五代本地训练方法能否支持客户端采样?能!
机器学习
2023-01-09 v2 分布式、并行与集群计算
最优化与控制
摘要
McMahan 等人 (2017) 提出的著名 FedAvg 算法基于三个组成部分:客户端采样 (CS)、数据采样 (DS) 和本地训练 (LT)。虽然前两者已被较好地理解,但第三个组成部分(其作用是减少训练模型所需的通信轮数)一直抗拒所有试图给出令人满意的理论解释的努力。Malinovsky 等人 (2022) 根据所提供的理论通信复杂度保证的质量,确定了四代不同的 LT 方法。尽管该领域取得了大量进展,现有工作均未能证明在重要的异构数据情形下,采用多个本地梯度类步长(即进行 LT)在理论上优于仅依赖单个本地梯度类步长。Mishchenko 等人 (2022) 通过其 ProxSkip 方法及其理论分析实现了近期突破,表明 LT 确实能为任意异构数据带来可证明的通信加速,从而启动了 LT 方法的第 代。然而,尽管这些最新一代 LT 方法与 DS 兼容,但它们均不支持 CS。我们以肯定的方式解决了这一开放问题。为此,我们不得不将算法开发建立在新的算法与理论基础之上。
引用
@article{arxiv.2212.14370,
title = {Can 5th Generation Local Training Methods Support Client Sampling? Yes!},
author = {Michał Grudzień and Grigory Malinovsky and Peter Richtárik},
journal= {arXiv preprint arXiv:2212.14370},
year = {2023}
}
备注
38 pages, 2 figures, 5 algorithms, 2 tables