中文

面向应用的具有相关属性的隐私保护数据发布

机器学习 2021-01-06 v2 密码学与安全 机器学习

摘要

计算领域的最新进展使得收集大量关于个人活动和私人生活空间的数据成为可能。为了解决用户在此环境中的隐私问题,我们提出了一种名为PR-GAN的新框架,该框架使用生成对抗网络提供隐私保护机制。给定一个目标应用,PR-GAN自动修改数据以隐藏敏感属性——这些属性可能是隐藏的,并且可以被机器学习算法推断出来——同时保留目标应用中的数据效用。与先前的工作不同,公众可能了解目标应用与敏感属性之间的相关性,这一点被纳入我们的建模中。我们将问题表述为一个优化问题,证明最优解存在,并使用生成对抗网络(GAN)创建扰动。我们进一步证明,我们的方法在Pufferfish框架下提供了隐私保证,这是差分隐私的一个优雅推广,允许对数据和相关性的先验知识进行建模。通过实验,我们表明我们的方法在有效隐藏敏感属性的同时,保证了目标应用的高性能,无论是用于属性推断还是训练目的。最后,我们通过进一步的实验证明,一旦我们的模型学习了一个隐私保护任务(例如隐藏受试者身份)在一组个体上,它可以在另一组个体上执行相同的任务,且性能下降最小。

关键词

引用

@article{arxiv.1812.10193,
  title  = {Application-driven Privacy-preserving Data Publishing with Correlated Attributes},
  author = {Aria Rezaei and Chaowei Xiao and Jie Gao and Bo Li and Sirajum Munir},
  journal= {arXiv preprint arXiv:1812.10193},
  year   = {2021}
}

备注

12 pages