基于 GAN 数据合成的联邦聚类
机器学习
2023-10-24 v2
摘要
联邦聚类(FC)是集中式聚类在联邦设定下的扩展。其核心在于如何在不共享私有数据的情况下构建全局相似性度量,因为局部相似性可能不足以正确分组局部数据,且由于隐私约束无法直接度量跨客户端的样本相似性。显然,分析 FC 最直接的方法是采用从集中式方法扩展而来的算法,如 K-means(KM)和模糊 c-means(FCM)。然而,它们易受客户端间非独立同分布(non-IID)数据的影响。为此,我们提出一种新的联邦聚类框架,称为合成数据辅助联邦聚类(SDA-FC)。它在每个客户端本地训练生成对抗网络(GAN)并将生成的合成数据上传至服务器,在合成数据上执行 KM 或 FCM。合成数据可使模型对 non-IID 问题免疫,并让我们能够在不共享私有数据的情况下更有效地捕捉全局相似性特征。综合实验揭示了 SDA-FC 的优势,包括在解决 non-IID 问题和设备失效方面表现优越。
引用
@article{arxiv.2210.16524,
title = {Federated clustering with GAN-based data synthesis},
author = {Jie Yan and Jing Liu and Ji Qi and Zhong-Yuan Zhang},
journal= {arXiv preprint arXiv:2210.16524},
year = {2023}
}