中文

面向非IID数据的异步联邦聚类:关于聚类数未知问题的解决

机器学习 2024-12-31 v1 分布式、并行与集群计算

摘要

联邦聚类(FC)是从多个客户端提供的无标签非独立同分布(non-IID)数据中挖掘知识的关键技术,同时能够保持客户端的隐私。目前大多数研究方法在本地客户端学习聚类分布,然后安全地将去识别化的信息传递给服务器进行聚合。然而,一些棘手但常见的FC问题仍鲜有探索,包括客户端通信容量的异构性以及正确聚类数k*的未知性。为进一步弥合FC与实际应用场景之间的差距,本文首先表明客户端通信的非同步性与未知k*是复杂的耦合问题,随后提出了一种异步联邦聚类学习(AFCL)方法。该方法将过多的初始种子点分发给各客户端作为学习载体,并在各客户端之间协调这些种子点以形成一致。为缓解由于来自异构客户端的不可预见异步上传导致的分布不平衡,本文还设计了一种用于种子更新的平衡机制。最终,种子点逐渐相互适应,从而揭示出恰当的聚类数。大量实验表明AFCL方法的有效性。

关键词

引用

@article{arxiv.2412.20341,
  title  = {Asynchronous Federated Clustering with Unknown Number of Clusters},
  author = {Yunfan Zhang and Yiqun Zhang and Yang Lu and Mengke Li and Xi Chen and Yiu-ming Cheung},
  journal= {arXiv preprint arXiv:2412.20341},
  year   = {2024}
}

备注

Accepted by AAAI 2025