一种针对合成数据的属性推断攻击的线性重构方法
机器学习
2024-05-10 v3 密码学与安全
摘要
合成数据生成(SDG)近期的进展被誉为在保护隐私的同时共享敏感数据这一难题的解决方案。SDG旨在学习真实数据的统计特性,以生成在结构和统计上与敏感数据相似的“人工”数据。然而,先前的研究表明,针对合成数据的推断攻击会损害隐私,但仅针对特定的离群记录。在本文中,我们提出了一种针对合成数据的新属性推断攻击。该攻击基于针对聚合统计量的线性重构方法,其目标是数据集中的所有记录,而不仅仅是离群值。我们在最先进的SDG算法上评估了我们的攻击,包括概率图模型、生成对抗网络(GAN)以及近期的差分隐私SDG机制。通过定义一个形式化的隐私博弈,我们表明我们的攻击即使在任意记录上也能高度准确,并且这是个体信息泄露(而非群体层面推断)的结果。随后我们系统地评估了保护隐私与保持统计效用之间的权衡。我们的发现表明,当前的SDG方法无法在保持合理效用的同时一致地提供针对推断攻击的充分隐私保护。所评估的最佳方法,一种差分隐私SDG机制,能够提供针对推断攻击的保护和合理的效用,但仅在特定设置下。最后,我们表明发布更大数量的合成记录可以改善效用,但代价是使攻击更加有效。
引用
@article{arxiv.2301.10053,
title = {A Linear Reconstruction Approach for Attribute Inference Attacks against Synthetic Data},
author = {Meenatchi Sundaram Muthu Selva Annamalai and Andrea Gadotti and Luc Rocher},
journal= {arXiv preprint arXiv:2301.10053},
year = {2024}
}