REPA:在非IID场景下无需训练与数据标签的客户端聚类以改进联邦学习
机器学习
2023-09-26 v1
摘要
将客户端聚类为具有相对同质数据分布的分组,是改进非独立同分布(non-IID)数据设置下联邦学习(FL)性能的主要手段之一。然而,当前最先进方法的适用性仍然有限,因为这些方法基于诸如本地模型参数演化等信息来聚类客户端,而此类信息仅能通过实际的客户端训练获得。另一方面,有必要使FL模型可供无法自行执行训练的客户端使用,因为它们不具备训练所需的处理能力,或仅想使用模型而不参与训练。此外,现有的避免训练的替代方法仍要求各个客户端拥有足以支撑聚类的标注数据量,本质上假定每个客户端都是数据标注者。本文提出REPA,一种在非IID FL设置下既不需要训练也不需要标注数据收集的客户端聚类方法。REPA使用一种基于有监督自编码器的新型方法来创建刻画客户端底层数据生成过程的嵌入,既不向服务器暴露数据,也不要求本地训练。我们在三个不同数据集上的实验分析表明,REPA在将基于聚类的FL的适用性扩展到此前未覆盖的用例的同时,实现了最先进的模型性能。
引用
@article{arxiv.2309.14088,
title = {REPA: Client Clustering without Training and Data Labels for Improved Federated Learning in Non-IID Settings},
author = {Boris Radovič and Veljko Pejović},
journal= {arXiv preprint arXiv:2309.14088},
year = {2023}
}