中文

Federated Clustering: 去中心化数据分布的逐簇无监督训练

机器学习 2026-01-09 v3

摘要

联邦学习(FL)实现了去中心化的机器学习,同时保护数据隐私,使其成为数据无法共享的敏感应用的理想选择。尽管 FL 在监督学习场景中已被广泛研究,但其在无监督学习中的应用仍不成熟。本工作提出 FedCRef,一种新型无监督联邦学习方法,旨在无需标签的情况下揭示跨去中心化客户端的所有底层数据分布。这一任务被称为联邦聚类,由于数据分布的异质性和非均匀性以及缺乏集中协调而面临挑战。与先前假设每客户端单簇或需要预先知晓簇数量的方法不同,FedCRef 推广至每客户端多簇场景。客户端在发现系统中所有不同分布的同时迭代优化其数据划分。该过程结合了局部聚类、通过重构误差分析的模型交换与评估,以及在相似分布的联邦组内的协作优化,以提升聚类精度。在四个公开数据集(EMNIST、KMNIST、Fashion-MNIST 和 KMNIST49)上的大量评估表明,FedCRef 成功识别了真实的全局数据分布,实现了高达 95% 的平均局部准确率。该方法对噪声条件具有鲁棒性、可扩展且轻量,适合资源受限的边缘设备。

关键词

引用

@article{arxiv.2408.10664,
  title  = {Federated Clustering: An Unsupervised Cluster-Wise Training for Decentralized Data Distributions},
  author = {Mirko Nardi and Lorenzo Valerio and Andrea Passarella},
  journal= {arXiv preprint arXiv:2408.10664},
  year   = {2026}
}