非独立同分布数据下的联邦学习
机器学习
2022-07-22 v2 机器学习
摘要
联邦学习使资源受限的边缘计算设备(如手机和物联网设备)能够在保持训练数据本地化的同时学习一个共享的预测模型。这种分散式的模型训练方式带来了隐私、安全、监管和经济上的益处。本工作中,我们关注当本地数据为非独立同分布(non-IID)时联邦学习的统计挑战。我们首先表明,对于在高度偏斜的非IID数据(每个客户端设备仅训练单一类别数据)上训练的神经网络的联邦学习,其准确率显著下降,降幅高达55%。我们进一步表明,该准确率下降可由权重散度解释,其可通过每个设备上类别分布与总体分布之间的推土机距离(EMD)来量化。作为解决方案,我们提出一种策略,通过创建一个在所有边缘设备间全局共享的小数据子集来改善非IID数据上的训练。实验表明,对于CIFAR-10数据集,仅使用5%的全局共享数据即可将准确率提升30%。
引用
@article{arxiv.1806.00582,
title = {Federated Learning with Non-IID Data},
author = {Yue Zhao and Meng Li and Liangzhen Lai and Naveen Suda and Damon Civin and Vikas Chandra},
journal= {arXiv preprint arXiv:1806.00582},
year = {2022}
}