基于指数机制与最大覆盖的差分隐私 $k$-均值聚类
数据结构与算法
2020-09-03 v1 密码学与安全
机器学习
摘要
我们引入了一种新的用于 -均值聚类问题的 -差分隐私算法。给定欧几里得空间中的数据集,-均值聚类问题要求在该空间中找到 个点,使得每个数据点与所返回的 个点中各自最近点之间的欧几里得距离平方和最小。尽管存在具有良好理论保证的隐私保护方法来解决此问题[Balcan et al., 2017; Kaplan and Stemmer, 2018],但在实践中可见,正是加性误差决定了这些方法的实际性能。通过将问题归约为网格上的一系列最大覆盖实例,我们得以推导出一种新方法,其加性误差低于以往工作。对于基数为 、直径为 的输入数据集,我们的算法具有 的加性误差,同时保持常数乘性误差。我们以若干实验作结,发现相对于此前已实现的该问题工作有所改进。
引用
@article{arxiv.2009.01220,
title = {Differentially private $k$-means clustering via exponential mechanism and max cover},
author = {Anamay Chaturvedi and Huy Nguyen and Eric Xu},
journal= {arXiv preprint arXiv:2009.01220},
year = {2020}
}