中文

通过局部更新的层次聚类的联邦学习以改进非独立同分布数据上的训练

机器学习 2020-05-07 v2 机器学习

摘要

联邦学习(FL)是一种在大规模分布式数据上执行机器学习任务的成熟方法。然而,在数据以非独立同分布(non-iid, not independent and identically distributed)方式分布的情况下——正如现实世界情形中的典型情况——与在 iid 数据上训练相比,FL 产生的联合模型在测试集准确率和/或通信成本方面表现不佳。我们表明,在某些类型的非 iid 数据存在时,学习单一联合模型往往不是最优的。在这项工作中,我们通过对 FL 引入一个层次聚类步骤(FL+HC)来修改 FL,以根据客户端局部更新与全局联合模型的相似性将客户端分离成簇。分离后,各簇在专门的模型上独立且并行地训练。我们针对若干 iid 和非 iid 设定,对 FL+HC 的超参数进行了稳健的实证分析。我们展示了与无聚类的 FL 相比,FL+HC 如何让模型训练在更少的通信轮数内收敛(在某些非 iid 设定下显著如此)。此外,与标准 FL 相比,FL+HC 让达到目标准确率的客户端比例更高。最后,我们给出了良好默认超参数的建议,以在不修改底层联邦学习通信协议的情况下促进性能更优的专门模型。

关键词

引用

@article{arxiv.2004.11791,
  title  = {Federated learning with hierarchical clustering of local updates to improve training on non-IID data},
  author = {Christopher Briggs and Zhong Fan and Peter Andras},
  journal= {arXiv preprint arXiv:2004.11791},
  year   = {2020}
}

备注

Accepted to 2020 International Joint Conference on Neural Networks (IJCNN)