中文

基于层次聚类并自动选择最优聚类数的联邦学习框架

机器学习 2026-03-16 v1 人工智能 分布式、并行与集群计算

摘要

联邦聚类(FC)是一种在无监督方式下探索分布式隐私保护数据分布模式的新兴且有前景的解决方案。现有 FC 方法隐含假设客户端拥有已知数量的均匀大小聚类,但实际场景中聚类数量通常未知且聚类大小天然不均衡。此外,联邦学习中的隐私保护传输约束不可避免地降低可用信息,使得开发健壮且准确的 FC 极具挑战。为此,我们提出一种新型 FC 框架Fed-kk^*-HC,可基于层次聚类探索的数据分布自动确定最优聚类数kk^*。为获得用于kk^*确定的全局数据分布,我们使每个客户端生成微型聚类,其原型随后上传至服务器进行层次合并。基于密度的合并设计允许探索大小和形状各异的聚类,渐进式合并过程可根据原型之间的相邻关系自行终止,从而确定kk^*。在多样化数据集上进行的大量实验表明,所提出的Fed-kk^*-HC在准确探索合适聚类数的方面展现了FC能力。

关键词

引用

@article{arxiv.2603.12684,
  title  = {Federated Hierarchical Clustering with Automatic Selection of Optimal Cluster Numbers},
  author = {Yue Zhang and Chuanlong Qiu and Xinfa Liao and Yiqun Zhang},
  journal= {arXiv preprint arXiv:2603.12684},
  year   = {2026}
}

备注

29 pages, 7 figures