中文

基于核密度估计的表格合成数据成员披露风险量化

机器学习 2026-03-12 v1 应用统计

摘要

合成数据的使用日益流行,作为保护隐私的替代方案,尤其在医疗、金融和人口学等敏感领域。然而,合成数据的隐私保障并非绝对,仍面临成员推断攻击(MIAs),即对抗者试图确定特定个体是否位于用于训练生成器的数据集中。本文提出了一种实用且有效的方法,通过核密度估计(KDE)来量化表格合成数据集中的成员披露风险。我们的KDE方法通过建模合成数据与训练记录之间的最近邻距离分布,实现对成员身份的概率推断,并通过ROC曲线实现稳健的风险评估。我们提出了两种攻击模型:一种是'真实分布攻击',假设拥有训练数据的特权访问权限;一种是更真实且可实现的'现实攻击',使用辅助数据但无需真实的成员标签。跨越四个真实数据集和六个合成数据生成器的实证评估表明,我们的方法在F1分数和风险特征描述方面 consistently 优于先前的基线方法,且无需计算昂贵的阴影模型。该方法为量化合成数据中的成员披露风险提供了实用框架和指标,使数据托管者能够在发布用于下游应用的合成数据集之前进行风险评估。本研究的数据和代码已在 https://github.com/PyCoder913/MIA-KDE 上提供。

关键词

引用

@article{arxiv.2603.10937,
  title  = {Quantifying Membership Disclosure Risk for Tabular Synthetic Data Using Kernel Density Estimators},
  author = {Rajdeep Pathak and Sayantee Jana},
  journal= {arXiv preprint arXiv:2603.10937},
  year   = {2026}
}