中文

差分隐私集合并集

密码学与安全 2022-04-08 v2 数据结构与算法 机器学习 机器学习

摘要

我们研究差分隐私全局模型下集合并集这一基本操作。在该问题中,给定一个可能无穷大的条目全集 UU 和一个用户数据库 DD。每个用户 ii 贡献一个条目子集 WiUW_i \subseteq U。我们需要一个 (ϵ\epsilon,δ\delta)-差分隐私算法,输出一个子集 SiWiS \subset \cup_i W_i,使得 SS 的大小尽可能大。该问题出现在无数现实应用中;它在自然语言处理(NLP)应用中尤其普遍,如词汇提取。例如,从属于用户的私有文本数据中发现词、句子、nn-gram 等就是集合并集问题的一个实例。该问题的已知算法通过从每个用户收集条目子集、取这些子集的并集、并公开带噪计数高于某一阈值的条目来进行的。关键的是,在上述过程中,每个个体的贡献总是独立于其他用户持有的条目,导致浪费的聚合过程,其中某些条目计数远高于阈值。我们偏离上述范式,允许用户以依赖方式\textit{依赖方式}策略\textit{策略}引导下贡献其条目。在这一新设定下确保隐私尤为微妙。我们证明任何具有某些收缩\textit{收缩}性质的策略都会得到一个差分隐私算法。我们设计了两种新算法,一种使用 Laplace 噪声,另一种使用 Gaussian 噪声,作为满足收缩性质的策略的具体实例。我们的实验表明,新算法显著优于该问题先前已知的机制。

关键词

引用

@article{arxiv.2002.09745,
  title  = {Differentially Private Set Union},
  author = {Sivakanth Gopi and Pankaj Gulhane and Janardhan Kulkarni and Judy Hanwen Shen and Milad Shokouhi and Sergey Yekhanin},
  journal= {arXiv preprint arXiv:2002.09745},
  year   = {2022}
}

备注

23 pages, 7 figures