MST 和 PrivBayes 中高 Epsilon 合成数据的漏洞
密码学与安全
2024-02-13 v1
摘要
合成数据生成(SDG)作为一种隐私增强技术越来越受欢迎。其旨在保持底层训练数据的重要统计属性,同时排除任何个人身份信息。近年来已开发出大量 SDG 算法以改进并平衡这两个目标。许多此类算法提供了鲁棒的差分隐私保证。然而,我们在此表明,如果差分隐私参数 设置得过高,则可能导致明确的隐私泄露。我们通过对两种最先进的差分隐私 SDG 算法 MST 和 PrivBayes 进行新颖的成员推断攻击(MIA)来证明这一点。我们的工作表明,这些生成器中存在此前未见的漏洞,建议未来的工作应加强其隐私性。我们在此提出了我们 MIA 的启发式方法。它假设知晓辅助的“总体”数据,并假设知晓使用了哪种 SDG 算法。我们利用这些信息将最近的 DOMIAS MIA 独特地适配于 MST 和 PrivBayes。我们的方法随后赢得了 2023 年 11 月的 SNAKE 挑战赛。
引用
@article{arxiv.2402.06699,
title = {High Epsilon Synthetic Data Vulnerabilities in MST and PrivBayes},
author = {Steven Golob and Sikha Pentyala and Anuar Maratkhan and Martine De Cock},
journal= {arXiv preprint arXiv:2402.06699},
year = {2024}
}