中文

利用高斯Copula差分隐私发布高维数据集

密码学与安全 2019-02-06 v1 数据结构与算法

摘要

我们提出一种通用机制,以高效发布具有高可用性的差分隐私合成版高维数据集。我们机制中的核心技术是使用copula。具体而言,我们使用高斯copula来定义输入数据集中属性的依赖关系,其各行被建模为来自未知多元分布的样本,然后通过该copula抽样合成记录。尽管高斯相关性本质上具有数值性质,我们构建的方法同样适用于数值和类别属性。我们的机制高效,其耗时仅与数据集中属性数量的平方成正比。我们提出了一种在不损害计算效率的前提下构建高斯copula的差分隐私方法。通过对三个真实世界数据集的实验,我们表明能够对全部一维边际以及二维和三维正合取查询获得高度准确的答案,其中99%的查询答案绝对(分数)误差率在0.01至3%之间。此外,对于大多数二维和三维查询,我们优于通过著名的Laplace机制进行的独立噪声添加。在计算时间方面,我们证明我们的机制在约200个二元属性和超过32,000行、约700个二元属性和超过500万行的输入数据集上,分别平均约6分47秒和约2小时30分输出合成数据集。为进一步展示可扩展性,我们在具有1,000和2,000个二元属性(及500万行)的更大(人工)数据集上运行该机制,分别在约6和19小时内获得合成输出。

关键词

引用

@article{arxiv.1902.01499,
  title  = {Differentially Private Release of High-Dimensional Datasets using the Gaussian Copula},
  author = {Hassan Jameel Asghar and Ming Ding and Thierry Rakotoarivelo and Sirine Mrabet and Mohamed Ali Kaafar},
  journal= {arXiv preprint arXiv:1902.01499},
  year   = {2019}
}