中文

差分隐私 $k$-均值聚类

密码学与安全 2015-04-24 v1

摘要

差分隐私数据分析有两类广义方法。交互式方法旨在为各种数据挖掘任务开发定制的差分隐私算法。非交互式方法旨在开发可输出输入数据集概要的差分隐私算法,该概要随后可用于支持各种数据挖掘任务。本文研究交互式与非交互式方法的权衡,并提出一种结合交互与非交互的混合方法,以 kk-均值聚类为例。在差分隐私 kk-均值聚类的混合方法中,首先使用非交互机制发布输入数据集的概要,然后应用标准 kk-均值聚类算法学习 kk 个聚类质心,最后使用交互式方法进一步改进这些聚类质心。我们分析了非交互与交互方法的误差行为,并据此分析决定如何在非交互步骤与交互步骤间分配隐私预算。大量实验的结果支持我们的分析并证明了方法的有效性。

关键词

引用

@article{arxiv.1504.05998,
  title  = {Differentially Private $k$-Means Clustering},
  author = {Dong Su and Jianneng Cao and Ninghui Li and Elisa Bertino and Hongxia Jin},
  journal= {arXiv preprint arXiv:1504.05998},
  year   = {2015}
}