基于生成对抗网络的数据合成
数据库
2018-07-04 v5 密码学与安全
摘要
在我们这个与合作伙伴共享数据或向公众发布数据屡见不鲜的社会中,隐私是一个重要关切。当前用于实现隐私的一些技术包括删除标识符、改动准标识符以及扰动数值。遗憾的是,这些方法存在两个局限。首先,已表明若攻击者拥有某些背景知识或其他信息源,私人信息仍可能泄露。其次,它们未考虑这些方法对发布数据效用所产生的不利影响。本文提出一种同时满足两项要求的方法。我们的方法称为 table-GAN,利用生成对抗网络(GANs)合成与原始表统计相似却又不会导致信息泄露的伪造表。我们表明,使用我们的合成表训练的机器学习模型,对未知测试案例表现出与使用原始表训练的模型相似的性能。我们称此性质为模型兼容性。我们认为,不具备模型兼容性的匿名化/扰动/合成方法价值甚微。我们使用来自四个不同领域的四个真实世界数据集进行实验,并与最先进的匿名化、扰动和生成技术做了深入比较。在整个实验中,仅我们的方法始终展现出隐私级别与模型兼容性之间的平衡。
引用
@article{arxiv.1806.03384,
title = {Data Synthesis based on Generative Adversarial Networks},
author = {Noseong Park and Mahmoud Mohammadi and Kshitij Gorde and Sushil Jajodia and Hongkyu Park and Youngmin Kim},
journal= {arXiv preprint arXiv:1806.03384},
year = {2018}
}
备注
Full Version - VLDB 2018