中文

探讨数据域提取对合成数据隐私的影响

密码学与安全 2025-04-15 v2 机器学习

摘要

隐私攻击,特别是成员推断攻击 (MIA),被广泛用于评估表格型合成数据的生成模型隐私,包括具有差分隐私保证的模型。这些攻击通常利用离群值,因为它们因位于数据域边界(例如最小值和最大值)而尤其脆弱。然而,数据域提取在生成模型中的作用及其对隐私攻击的影响被忽略了。本文我们检查了三种定义数据域的策略:假设它是外部提供的(理想情况下来自公共数据),从输入数据中直接提取,以及使用差分隐私机制提取。虽然在流行的实现和库中常见,但我们显示第二种方法会破坏端到端的差分隐私保证并使模型暴露于攻击。虽然使用提供的域(如果具有代表性)更可取,但使用差分隐私机制提取也能防御流行的MIA,即使在高隐私预算下也可行。

关键词

引用

@article{arxiv.2504.08254,
  title  = {Understanding the Impact of Data Domain Extraction on Synthetic Data Privacy},
  author = {Georgi Ganev and Meenatchi Sundaram Muthu Selva Annamalai and Sofiane Mahiou and Emiliano De Cristofaro},
  journal= {arXiv preprint arXiv:2504.08254},
  year   = {2025}
}

备注

Accepted to the Synthetic Data x Data Access Problem workshop (SynthData), part of ICLR 2025