中文

MST 和 PrivBayes 中高 Epsilon 合成数据的漏洞

密码学与安全 2024-02-13 v1

摘要

合成数据生成(SDG)作为一种隐私增强技术越来越受欢迎。其旨在保持底层训练数据的重要统计属性,同时排除任何个人身份信息。近年来已开发出大量 SDG 算法以改进并平衡这两个目标。许多此类算法提供了鲁棒的差分隐私保证。然而,我们在此表明,如果差分隐私参数 ε\varepsilon 设置得过高,则可能导致明确的隐私泄露。我们通过对两种最先进的差分隐私 SDG 算法 MST 和 PrivBayes 进行新颖的成员推断攻击(MIA)来证明这一点。我们的工作表明,这些生成器中存在此前未见的漏洞,建议未来的工作应加强其隐私性。我们在此提出了我们 MIA 的启发式方法。它假设知晓辅助的“总体”数据,并假设知晓使用了哪种 SDG 算法。我们利用这些信息将最近的 DOMIAS MIA 独特地适配于 MST 和 PrivBayes。我们的方法随后赢得了 2023 年 11 月的 SNAKE 挑战赛。

关键词

引用

@article{arxiv.2402.06699,
  title  = {High Epsilon Synthetic Data Vulnerabilities in MST and PrivBayes},
  author = {Steven Golob and Sikha Pentyala and Anuar Maratkhan and Martine De Cock},
  journal= {arXiv preprint arXiv:2402.06699},
  year   = {2024}
}