合成数据即所需:去除合成数据成员推断攻击的辅助数据假设
密码学与安全
2024-02-05 v2 人工智能
摘要
合成数据正成为在保障隐私的同时共享个体级数据的最有前景的方案之一。虽然基于影子建模的成员推断攻击(MIA)已成为评估合成数据隐私性的标准方法,但它们目前假设攻击者能够访问从与训练数据集相似分布中采样的辅助数据集。这在实践中常被视为极强的假设,尤其是所提出的合成表格数据主要用例(如医疗数据、金融交易)非常特定,且没有直接可用的参考数据集。我们在此展示如何去除该假设,使得仅使用合成数据即可实施 MIA。具体而言,我们开发了三种不同场景:(S1)对生成器的黑盒访问,(S2)仅能访问发布的合成数据集,以及(S3)仅使用合成数据的攻击性能上界的理论设定。我们的结果表明,在两个真实世界数据集和两种合成数据生成器上,MIA 仍然成功。这些结果显示,在审计合成数据发布时所做的强假设——访问辅助数据集——可被放宽,使攻击在现实中更为可行。
引用
@article{arxiv.2307.01701,
title = {Synthetic is all you need: removing the auxiliary data assumption for membership inference attacks against synthetic data},
author = {Florent Guépin and Matthieu Meeus and Ana-Maria Cretu and Yves-Alexandre de Montjoye},
journal= {arXiv preprint arXiv:2307.01701},
year = {2024}
}