中文

通过衰减本地 SGD 步数实现更快的联邦学习

机器学习 2023-05-17 v1

摘要

在联邦学习(FL)中,通过互联网连接的客户端设备协作训练机器学习模型,而无需与中央服务器或其他客户端共享其私有数据。开创性的联邦平均(FedAvg)算法通过在客户端上执行本地训练轮次随后进行模型平均来训练单一全局模型。FedAvg 可通过在每轮中于客户端上执行更多步随机梯度下降(SGD)来提高训练通信效率。然而,现实世界 FL 中的客户端数据高度异构,已广泛表明当每轮在客户端上执行 K>1K > 1 步 SGD 时会减缓模型收敛并损害最终性能。在这项工作中,我们提出随着训练推进使 KK 衰减,与固定 KK 相比,可在改善 FL 模型最终性能的同时减少训练挂钟时间与总计算成本。我们分析了具有衰减 KK 的 FedAvg 在强凸目标下的收敛性,提供了对收敛性质的新见解,并推导了三种基于理论动机的 KK 衰减调度。随后,我们在四个基准 FL 数据集(FEMNIST、CIFAR100、Sentiment140、Shakespeare)上进行了充分实验,以展示我们的方法在真实收敛时间、计算成本和泛化性能方面的实际益处。

关键词

引用

@article{arxiv.2305.09628,
  title  = {Faster Federated Learning with Decaying Number of Local SGD Steps},
  author = {Jed Mills and Jia Hu and Geyong Min},
  journal= {arXiv preprint arXiv:2305.09628},
  year   = {2023}
}