具有收敛保证的差分隐私 k-Means 聚类
密码学与安全
2022-04-05 v1 机器学习
摘要
迭代聚类算法有助于我们了解数据背后的洞察。不幸的是,这可能使攻击者借助某些背景知识推断个体的隐私。在最坏情况下,攻击者知道任意一次迭代的中心点以及 n 个项中 n-1 个项的信息。为防止此类推断攻击对个体隐私的侵害,在交互式设定下为迭代聚类算法保护差分隐私(DP)已被广泛研究。然而,现有的交互式差分隐私聚类算法存在不收敛问题,即这些算法在没有预定义迭代次数时可能不终止。该问题严重影响了聚类质量与差分隐私算法的效率。为解决此问题,本文提出一种新颖的交互式设定下差分隐私聚类框架,其通过在选择区域注入 DP 噪声来控制迭代过程中中心点的移动方向,从而保证收敛。我们证明,在期望情形下,该框架下的算法至多以 Lloyd 算法两倍的迭代次数收敛。我们在真实数据集上进行了实验评估,表明我们的算法在满足相同 DP 要求下,以有保证的收敛和更好的聚类质量优于最先进的交互式差分隐私聚类算法。
引用
@article{arxiv.2002.01043,
title = {Differentially Private k-Means Clustering with Guaranteed Convergence},
author = {Zhigang Lu and Hong Shen},
journal= {arXiv preprint arXiv:2002.01043},
year = {2022}
}