中文

阿喀琉斯之踵:合成数据发布中的脆弱记录识别

密码学与安全 2024-02-12 v2 人工智能

摘要

合成数据被视为在保护隐私的同时共享个体层面数据的最有前景的解决方案。基于影子建模的成员推断攻击(MIAs)已成为评估合成数据隐私风险的标准方法。尽管非常有效,它们需要创建大量数据集并训练模型,以评估单条记录所构成的风险。因此,数据集的隐私风险目前是通过使用临时方法选出的少数记录上运行MIAs来评估的。我们在此提出,据我们所知,首个用于合成数据发布的基于原则性的脆弱记录识别技术,利用到记录最近邻的距离。我们表明我们的方法在跨数据集和生成器上大幅优于先前的临时方法。我们还展示证据表明我们的方法对MIA的选择和特定参数选择具有鲁棒性。最后,我们表明在合成数据生成器采用差分隐私时,它能准确识别脆弱记录。在评估合成数据发布的隐私性时,包括从法律视角,脆弱记录的选择与更精确的MIAs同样重要。我们在此提出一种简单但高效的方法来实现这一点。我们希望我们的方法能使从业者更好地估计合成数据发布带来的风险,并使研究人员能在合成数据上公平比较不断改进的MIAs。

关键词

引用

@article{arxiv.2306.10308,
  title  = {Achilles' Heels: Vulnerable Record Identification in Synthetic Data Publishing},
  author = {Matthieu Meeus and Florent Guépin and Ana-Maria Cretu and Yves-Alexandre de Montjoye},
  journal= {arXiv preprint arXiv:2306.10308},
  year   = {2024}
}