通过过拟合检测对合成数据发起成员推断攻击
机器学习
2023-02-27 v1 密码学与安全
摘要
数据大多是科学的基础。遗憾的是,共享数据可能因违反数据隐私的风险而受阻,阻碍了医疗保健等领域的研究。合成数据是一种潜在的解决方案。其旨在生成与原始数据分布相同但不泄露个人信息的资料。成员推断攻击(MIA)是一种常见的隐私攻击,攻击者可试图确定某个特定真实样本是否用于模型训练。先前提出的针对生成模型的 MIA 要么性能低下——给人数据高度私有的错误印象——要么需假设可访问生成模型内部参数——这是一种相对较低风险的场景,因为数据发布者通常只发布合成数据而非模型。本工作中,我们主张一种现实的 MIA 设定,即假设攻击者对所底层数据分布有一定了解。我们提出 DOMIAS,一种基于密度的 MIA 模型,旨在通过针对生成模型的局部过拟合来推断成员关系。实验表明,DOMIAS 在 MIA 上比先前工作成功得多,尤其在攻击不常见样本时。后者令人担忧,因为这些样本可能对应于代表性不足的群体。我们还展示了 DOMIAS 的 MIA 性能分数如何提供可解释的隐私度量,为数据发布者提供一种新工具,以在其合成数据中实现所需的隐私-效用权衡。
引用
@article{arxiv.2302.12580,
title = {Membership Inference Attacks against Synthetic Data through Overfitting Detection},
author = {Boris van Breugel and Hao Sun and Zhaozhi Qian and Mihaela van der Schaar},
journal= {arXiv preprint arXiv:2302.12580},
year = {2023}
}