中文

边际概率基于合成数据的隐私漏洞

密码学与安全 2025-04-02 v2 机器学习

摘要

在作为隐私增强技术时,合成数据生成(SDG)旨在保持与真实数据相似的特征,同时排除可识别个人信息。许多 SDG 算法提供稳健的差分隐私(DP)保证以此为目的。然而,我们展示了最强类别的 SDG 算法——即保留底层数据中\textit{边际概率}或类似统计量的算法——会泄露关于个人的信息,这些信息的恢复效率比以往更快。我们通过提出一种新颖的成员推断攻击 MAMA-MIA 来演示此点,并对其进行评估,针对三种关键 DP SDG 算法:MST、PrivBayes 和 Private-GSD。MAMA-MIA 利用对所使用的 SDG 算法已知的情况,使其比其他领先攻击更准确地学习关于隐藏数据的信息,速度快了多个数量级。我们使用 MAMA-MIA 为现有 SDG 漏洞提供见解。我们的 метод最终赢得了首届 SNAKE(SaNitization Algorithm under attacK ... ε\varepsilon)竞赛。

关键词

引用

@article{arxiv.2410.05506,
  title  = {Privacy Vulnerabilities in Marginals-based Synthetic Data},
  author = {Steven Golob and Sikha Pentyala and Anuar Maratkhan and Martine De Cock},
  journal= {arXiv preprint arXiv:2410.05506},
  year   = {2025}
}

备注

Accepted at 3rd IEEE Conference on Secure and Trustworthy Machine Learning (SaTML) 2025