非独立同分布去中心化数据下的有效联邦自适应梯度方法
机器学习
2020-12-23 v2 机器学习
摘要
联邦学习允许大量边缘计算设备在不共享数据的情况下协作学习一个全局模型。在非独立同分布且不平衡数据下考虑部分设备参与的分析更贴近现实。本工作中,我们提出自适应梯度方法的联邦学习版本——联邦 AGMs(Federated AGMs)——其同时利用一阶与二阶动量,以缓解设备间数据分布差异导致的泛化性能退化。为进一步提升测试性能,我们比较了几种自适应学习率的校准方案,包括由 校准的标准 Adam、-Adam,以及由激活函数校准的方案。我们的分析首次给出了一组理论结果:所提出的(经校准的)联邦 AGMs 在非独立同分布且不平衡数据设置下的非凸优化中收敛到一阶驻点。我们进行了大量实验,将这些联邦学习方法与最先进的 FedAvg、FedMomentum 和 SCAFFOLD 进行比较,并评估不同的校准方案以及 AGMs 相对于当前联邦学习方法的优势。
引用
@article{arxiv.2009.06557,
title = {Effective Federated Adaptive Gradient Methods with Non-IID Decentralized Data},
author = {Qianqian Tong and Guannan Liang and Jinbo Bi},
journal= {arXiv preprint arXiv:2009.06557},
year = {2020}
}
备注
42 pages