D-Cliques:在去中心化联邦学习中以拓扑补偿数据异构性
机器学习
2021-11-05 v4 人工智能
分布式、并行与集群计算
摘要
使用联邦学习训练的机器学习模型的收敛速度受异构数据划分的显著影响,在无需中心服务器的完全去中心化设定下尤为如此。本文表明,标签分布偏移这一重要数据异构类型的影响,可通过精心设计底层通信拓扑而显著削弱。我们提出 D-Cliques,一种新颖拓扑,其通过将节点分组于稀疏互连的团(clique)中,使团内标签分布代表全局标签分布,从而降低梯度偏差。我们还展示了如何调整去中心化 SGD 的更新以获得无偏梯度,并利用 D-Cliques 实现有效动量。我们在 MNIST 与 CIFAR10 上的广泛实证评估表明,我们的方法提供了与全连接拓扑相近的收敛速度(全连接拓扑在数据异构设定下提供最佳收敛),同时大幅减少了边数与消息数。在 1000 节点拓扑中,D-Cliques 所需边减少 98%、总消息减少 96%,且通过跨团的_small-world_ 拓扑可进一步获益。
引用
@article{arxiv.2104.07365,
title = {D-Cliques: Compensating for Data Heterogeneity with Topology in Decentralized Federated Learning},
author = {Aurélien Bellet and Anne-Marie Kermarrec and Erick Lavoie},
journal= {arXiv preprint arXiv:2104.07365},
year = {2021}
}
备注
18 pages, 26 figures. Revision v4: Made title and abstract more specific (data heterogeneity), added generalized clique construction algorithm (Greedy Swap), updated main text experiments to use generalized partitioning scheme, reorganized paper structure, re-ran and added previous experiments in appendix using updated simulator