合成数据——匿名化的土拨鼠之日
机器学习
2022-01-25 v6 密码学与安全
摘要
合成数据被宣传为隐私保护数据发布的灵丹妙药,可解决传统匿名化技术的缺陷。其承诺是,从生成模型抽取的合成数据保留了原始数据集的统计特性,同时提供针对隐私攻击的完美保护。在这项工作中,我们首次对合成数据发布的隐私增益进行定量评估,并将其与先前的匿名化技术进行比较。我们对一系列最先进生成模型的评估表明,合成数据要么无法阻止推断攻击,要么无法保留数据效用。换言之,我们通过实证表明,合成数据并未提供比传统匿名化技术更优的隐私与效用权衡。此外,与传统匿名化不同,合成数据发布的隐私-效用权衡难以预测。由于无法预测合成数据集将保留哪些信号以及哪些信息将丢失,合成数据导致高度可变的隐私增益和不可预测的效用损失。总之,我们发现合成数据远非隐私保护数据发布的圣杯。
引用
@article{arxiv.2011.07018,
title = {Synthetic Data -- Anonymisation Groundhog Day},
author = {Theresa Stadler and Bristena Oprisanu and Carmela Troncoso},
journal= {arXiv preprint arXiv:2011.07018},
year = {2022}
}