中文

弱约束域上的隐私保护合成数据集

数据库 2018-08-24 v1

摘要

生成隐私保护合成数据集的技术以敏感数据集为输入,在维持差分隐私的同时产出相似的数据集。这些方法有望改善数据的共享与复用,但它们必须便于非专家使用并能容忍真实数据。现有方法隐含假设数据集的活跃域与全局域相似,可能违反差分隐私。本文中,我们提出一种在大型、弱约束域上生成差分隐私合成数据的算法,这类域常见于现实开放数据场景。我们的算法将未表示的域解析地建模为概率分布,以调整输出并计算噪声,避免了显式计算完整域的需要。我们用一个“随机性容忍度”参数来表述隐私与效用之间的权衡,该参数无需用户检查数据即可设定。最后,我们展示了该算法在真实数据集上产生合理结果。

关键词

引用

@article{arxiv.1808.07603,
  title  = {Privacy-Preserving Synthetic Datasets Over Weakly Constrained Domains},
  author = {Luke Rodriguez and Bill Howe},
  journal= {arXiv preprint arXiv:1808.07603},
  year   = {2018}
}

备注

Submitted to TDPD18