中文

P3GM:基于隐私保护分阶段生成模型的高维数据隐私发布

机器学习 2022-03-08 v4 密码学与安全 数据库 机器学习

摘要

如何在缓解隐私风险的同时发布海量敏感数据?隐私保护数据合成使数据持有者能够将分析任务外包给不可信的第三方。该问题的最先进方法是在差分隐私下构建生成模型,从而提供严格的隐私保证。然而,现有方法无法充分处理高维数据。具体而言,当输入数据集包含大量特征时,现有技术需要注入过量的噪声以满足差分隐私,导致外包数据分析失去意义。为解决上述问题,本文提出了隐私保护分阶段生成模型(P3GM),这是一种用于发布此类敏感数据的差分隐私生成模型。P3GM 采用两阶段学习过程,使其对噪声具有鲁棒性,并提高学习效率(例如,易于收敛)。我们对 P3GM 的学习复杂度和隐私损失进行了理论分析。我们进一步对所提方法进行了实验评估,结果表明 P3GM 显著优于现有解决方案。与最先进方法相比,在数据多样性方面,我们生成的样本噪声更少且更接近原始数据。此外,在使用合成数据的几项数据挖掘任务中,我们的模型在准确率方面也优于竞争方法。

关键词

引用

@article{arxiv.2006.12101,
  title  = {P3GM: Private High-Dimensional Data Release via Privacy Preserving Phased Generative Model},
  author = {Shun Takagi and Tsubasa Takahashi and Yang Cao and Masatoshi Yoshikawa},
  journal= {arXiv preprint arXiv:2006.12101},
  year   = {2022}
}

备注

The version accepted at ICDE 2021 includes wrong proof in the Wishart mechanism. The current version fixes the problem