差分隐私集合并集
密码学与安全
2022-04-08 v2 数据结构与算法
机器学习
机器学习
摘要
我们研究差分隐私全局模型下集合并集这一基本操作。在该问题中,给定一个可能无穷大的条目全集 和一个用户数据库 。每个用户 贡献一个条目子集 。我们需要一个 (,)-差分隐私算法,输出一个子集 ,使得 的大小尽可能大。该问题出现在无数现实应用中;它在自然语言处理(NLP)应用中尤其普遍,如词汇提取。例如,从属于用户的私有文本数据中发现词、句子、-gram 等就是集合并集问题的一个实例。该问题的已知算法通过从每个用户收集条目子集、取这些子集的并集、并公开带噪计数高于某一阈值的条目来进行的。关键的是,在上述过程中,每个个体的贡献总是独立于其他用户持有的条目,导致浪费的聚合过程,其中某些条目计数远高于阈值。我们偏离上述范式,允许用户以在引导下贡献其条目。在这一新设定下确保隐私尤为微妙。我们证明任何具有某些性质的策略都会得到一个差分隐私算法。我们设计了两种新算法,一种使用 Laplace 噪声,另一种使用 Gaussian 噪声,作为满足收缩性质的策略的具体实例。我们的实验表明,新算法显著优于该问题先前已知的机制。
关键词
引用
@article{arxiv.2002.09745,
title = {Differentially Private Set Union},
author = {Sivakanth Gopi and Pankaj Gulhane and Janardhan Kulkarni and Judy Hanwen Shen and Milad Shokouhi and Sergey Yekhanin},
journal= {arXiv preprint arXiv:2002.09745},
year = {2022}
}
备注
23 pages, 7 figures