中文

一种新的聚类联邦学习方法:一种不共享模型的方法

机器学习 2026-01-07 v3

摘要

近年来,跨机构利用敏感数据的需求不断增长,导致对联邦学习(FL)的关注度提高。FL是一种无需共享原始数据即可进行模型训练的分布式机器学习范式。然而,现有的基于联邦学习的聚类方法(即联邦聚类)通常假设简单的数据划分场景,如水平或垂直划分,无法处理更复杂的分布结构。本研究提出了数据协作聚类(DC-Clustering),这是一种新的联邦聚类方法,支持水平和垂直划分共存的复杂数据划分场景下的聚类。在DC-Clustering中,每个机构仅共享中间表示,而不共享原始数据,从而在保护隐私的同时实现协作聚类。该方法允许在k-均值和谱聚类之间灵活选择,并通过一次与中心服务器的通信即可获得最终结果。我们使用合成数据和公开基准数据进行了广泛实验。结果表明,该方法在聚类性能上相当于集中式聚类(即将所有数据合并)的性能。DC-Clustering 解决了当前FL研究中的重要空白,使其能够从分布式异构数据中实现有效的知识发现。其实用属性——隐私保护、通信效率和灵活性——使其成为面向医疗保健和金融等隐私敏感领域的有前景的工具。

关键词

引用

@article{arxiv.2506.10244,
  title  = {A new type of federated clustering: A non-model-sharing approach},
  author = {Yuji Kawamata and Kaoru Kamijo and Masateru Kihira and Akihiro Toyoda and Tomoru Nakayama and Akira Imakura and Tetsuya Sakurai and Yukihiko Okada},
  journal= {arXiv preprint arXiv:2506.10244},
  year   = {2026}
}

备注

30 pages, 3 figures,