中文

合成数据——匿名化的土拨鼠之日

机器学习 2022-01-25 v6 密码学与安全

摘要

合成数据被宣传为隐私保护数据发布的灵丹妙药,可解决传统匿名化技术的缺陷。其承诺是,从生成模型抽取的合成数据保留了原始数据集的统计特性,同时提供针对隐私攻击的完美保护。在这项工作中,我们首次对合成数据发布的隐私增益进行定量评估,并将其与先前的匿名化技术进行比较。我们对一系列最先进生成模型的评估表明,合成数据要么无法阻止推断攻击,要么无法保留数据效用。换言之,我们通过实证表明,合成数据并未提供比传统匿名化技术更优的隐私与效用权衡。此外,与传统匿名化不同,合成数据发布的隐私-效用权衡难以预测。由于无法预测合成数据集将保留哪些信号以及哪些信息将丢失,合成数据导致高度可变的隐私增益和不可预测的效用损失。总之,我们发现合成数据远非隐私保护数据发布的圣杯。

关键词

引用

@article{arxiv.2011.07018,
  title  = {Synthetic Data -- Anonymisation Groundhog Day},
  author = {Theresa Stadler and Bristena Oprisanu and Carmela Troncoso},
  journal= {arXiv preprint arXiv:2011.07018},
  year   = {2022}
}