针对数据量不平衡的非独立同分布情形下的鲁棒聚类联邦学习方法
机器学习
2025-10-07 v1 人工智能
摘要
联邦学习是一种去中心化的范式,允许客户端-服务器体系结构在不共享原始数据的情况下协同训练全局人工智能模型,从而保留隐私。在联邦学习中,数据非独立同分布(Non-IID)是一项关键挑战。数据量不平衡(Quantity Skew, QS)是Non-IID中的一种特定问题,指客户端持有高度异构的数据 volumes。聚类联邦学习(Clustered Federated Learning, CFL)是联邦学习的一种新兴变体,为解决Non-IID问题提供了有前景的解决方案。它通过将具有相似数据分布的客户端分组到同一簇中来提高模型性能。CFL方法通常分为两种运营策略:一种是客户端选择最小化本地训练损失的簇;另一种是服务器基于本地模型相似性对客户端进行分组。然而,大多数CFL方法缺乏针对QS的系统评估,因为其面临重大挑战。本文提出了两个主要贡献:首先,对当前最先进的CFL算法进行评估,应用多种QS情景进行测试以评估其鲁棒性;其次,提出一种新的迭代CFL算法,称为CORNFLQS,通过在两种运营策略之间实现最优协调来应对不同QS设置的挑战。我们的做法对QS变异具有很强的鲁棒性。我们在六个图像分类数据集上进行大规模实验,产生了270种Non-IID配置。结果表明,CORNFLQS在准确率和聚类质量方面均实现最高平均排名,并且对QS扰动具有强大的鲁棒性。总体而言,我们的方法优于当前的CFL算法。
引用
@article{arxiv.2510.03380,
title = {A Robust Clustered Federated Learning Approach for Non-IID Data with Quantity Skew},
author = {Michael Ben Ali and Imen Megdiche and André Peninou and Olivier Teste},
journal= {arXiv preprint arXiv:2510.03380},
year = {2025}
}