中文

DCR幻觉:测量合成数据隐私风险

密码学与安全 2025-05-06 v1 人工智能 机器学习

摘要

合成数据日益流行用于在不透露敏感信息的情况下共享数据。尽管成员推断攻击(Membership Inference Attacks, MIAs)被广泛认为是衡量合成数据隐私的金标准,但实践者和研究人员常依赖更简单的代理指标,如距离最近记录(Distance to Closest Record, DCR)。这些指标通过衡量训练数据与生成合成数据之间的相似性来估计隐私;将其与训练数据与一个与之 disjoint的真实记录持有集之间的相似性进行比较,以构建二元隐私测试。如果合成数据与训练数据的相似性不更高于持有集,则视为通过测试,被认为是私密的。本文表明,尽管计算成本低,DCR及其他距离基指标未能识别隐私泄露。我们在多个数据集上进行实验,包括经典模型(如Baynet和CTGAN)以及更近期的扩散模型,显示那些被代理指标认为是私密的数据集对成员推断攻击极其脆弱。我们同样发现,这些二元隐私测试以及基于这些指标的连续测度对实际的成员推断风险毫无信息价值。我们进一步表明,这些失效在不同的指标超参数设置和记录选择方法下都保持一致。最后,我们论证DCR及其他距离基指标本质上存在缺陷,并给出一个实践中遗漏简单漏洞的示例。通过本工作,我们希望鼓励实践者摒弃代理指标,采用MIAs作为评估合成数据隐私的严格、全面的标准,尤其是为了宣称数据集具有法律上的匿名性。

关键词

引用

@article{arxiv.2505.01524,
  title  = {The DCR Delusion: Measuring the Privacy Risk of Synthetic Data},
  author = {Zexi Yao and Nataša Krčo and Georgi Ganev and Yves-Alexandre de Montjoye},
  journal= {arXiv preprint arXiv:2505.01524},
  year   = {2025}
}