中文

基于指数机制与最大覆盖的差分隐私 $k$-均值聚类

数据结构与算法 2020-09-03 v1 密码学与安全 机器学习

摘要

我们引入了一种新的用于 kk-均值聚类问题的 (ϵp,δp)(\epsilon_p, \delta_p)-差分隐私算法。给定欧几里得空间中的数据集,kk-均值聚类问题要求在该空间中找到 kk 个点,使得每个数据点与所返回的 kk 个点中各自最近点之间的欧几里得距离平方和最小。尽管存在具有良好理论保证的隐私保护方法来解决此问题[Balcan et al., 2017; Kaplan and Stemmer, 2018],但在实践中可见,正是加性误差决定了这些方法的实际性能。通过将问题归约为网格上的一系列最大覆盖实例,我们得以推导出一种新方法,其加性误差低于以往工作。对于基数为 nn、直径为 Δ\Delta 的输入数据集,我们的算法具有 O(Δ2(klog2nlog(1/δp)/ϵp+kdlog(1/δp)/ϵp))O(\Delta^2 (k \log^2 n \log(1/\delta_p)/\epsilon_p + k\sqrt{d \log(1/\delta_p)}/\epsilon_p)) 的加性误差,同时保持常数乘性误差。我们以若干实验作结,发现相对于此前已实现的该问题工作有所改进。

关键词

引用

@article{arxiv.2009.01220,
  title  = {Differentially private $k$-means clustering via exponential mechanism and max cover},
  author = {Anamay Chaturvedi and Huy Nguyen and Eric Xu},
  journal= {arXiv preprint arXiv:2009.01220},
  year   = {2020}
}