中文

FedSpectral+:使用联邦学习的谱聚类

机器学习 2023-02-07 v1

摘要

图中的聚类一直是一个众所周知的研究问题,特别是因为大多数互联网和社交网络数据都以图的形式存在。各组织广泛使用谱聚类算法来寻找图数据集中的聚类。然而,由于计算开销,将谱聚类应用于大型数据集具有挑战性。虽然存在分布式谱聚类算法,但它们面临数据隐私和客户端之间通信成本增加的问题。因此,在本文中,我们提出了一种使用联邦学习(FL)的谱聚类算法来克服这些问题。FL 是一种隐私保护算法,它从每个本地学习器累积模型参数,而不是收集用户的原始数据,从而同时提供可扩展性和数据隐私。我们开发了两种方法:FedSpectral 和 FedSpectral+。FedSpectral 是一种基线方法,它使用本地谱聚类标签,通过创建相似度图来聚合全局谱聚类。FedSpectral+ 是一种最先进的方法,它使用幂迭代方法,通过整合整个图数据来学习全局谱嵌入,而无需访问分布在客户端之间的原始信息。我们进一步设计了自己的相似度度量标准,以检查分布式方法相对于原始/非联邦学习聚类的聚类质量。所提出的 FedSpectral+ 方法在 ego-Facebook 和 email-Eu-core 数据集上分别获得了 98.85% 和 99.8% 的相似度,可与全局聚类相媲美。

关键词

引用

@article{arxiv.2302.02137,
  title  = {FedSpectral+: Spectral Clustering using Federated Learning},
  author = {Janvi Thakkar and Devvrat Joshi},
  journal= {arXiv preprint arXiv:2302.02137},
  year   = {2023}
}

备注

Accepted at GCLR Workshop, AAAI 2023