中文

差分隐私中选择的代价

数据结构与算法 2017-02-13 v1 密码学与安全

摘要

在差分隐私top-kk选择问题中,给定数据集 X{±1}n×dX \in \{\pm 1\}^{n \times d},其中每一行属于一个个体,每一列对应某个二元属性,我们的目标是找到一组 kdk \ll d 列,其均值尽可能大。差分隐私要求我们对这 kk 列的选择不能过度依赖于任何一个体的数据集。该问题可利用著名的指数机制以及差分隐私的组合性质求解。在高精度机制下,要求我们选择过程的误差小于所谓的采样误差 αln(d)/n\alpha \approx \sqrt{\ln(d)/n},此过程在给定大小为 nkln(d)n \gtrsim k \ln(d) 的数据集时成功。我们证明了一个匹配的下界,表明在该高精度机制下,私有top-kk选择必要的数据集大小为 nkln(d)n \gtrsim k \ln(d)。我们的下界首次表明,选择 kk 个最大列比仅估计这 kk 列的值需要更多数据,而后者仅需大小为 nkn \gtrsim k 的数据集即可完成。

关键词

引用

@article{arxiv.1702.02970,
  title  = {The Price of Selection in Differential Privacy},
  author = {Mitali Bafna and Jonathan Ullman},
  journal= {arXiv preprint arXiv:1702.02970},
  year   = {2017}
}