非独立同分布数据上的差分隐私联邦聚类
分布式、并行与集群计算
2023-11-07 v3 机器学习
摘要
本文研究联邦聚类(FedC)问题,旨在参数服务器协调下将分布于大量客户端上的无标签数据样本准确划分为有限个簇,同时考虑数据隐私。尽管这是一个涉及表示簇中心点的实变量与表示各数据样本簇隶属关系的二元变量的 NP 难优化问题,我们巧妙地将 FedC 问题重新表述为仅带一个凸约束的非凸优化问题,从而得到软聚类解。随后提出了一种使用差分隐私(DP)技术的新型 FedC 算法,称为 DP-FedC,其中还考虑了部分客户端参与与多步本地模型更新。此外,通过对隐私保护与收敛速率的理论分析,获得了所提 DP-FedC 的多项性质,尤其针对非独立同分布(non-i.i.d.)数据情形,这些性质理想地作为所提 DP-FedC 设计的指导。然后在两个真实数据集上给出了一些实验结果,证明了所提 DP-FedC 的有效性及其相对于若干 SOTA FedC 算法的更优性能,并且与所有给出的分析结果一致。
引用
@article{arxiv.2301.00955,
title = {Differentially Private Federated Clustering over Non-IID Data},
author = {Yiwei Li and Shuai Wang and Chong-Yung Chi and Tony Q. S. Quek},
journal= {arXiv preprint arXiv:2301.00955},
year = {2023}
}
备注
34 pages, 4 figures, 1 table