基于 NIST PSCR 差分隐私合成数据挑战赛的不同差分隐私合成数据算法比较研究
应用统计
2020-10-13 v3 密码学与安全
机器学习
摘要
差分隐私合成数据生成提供了一种近期解决方案,可在保留数据中个体隐私的同时发布具有分析用途的数据。为使政策制定者能利用这些算法进行公共政策决策,他们需要准确理解这些算法的相对性能。相应地,数据从业者需要标准度量来评估合成数据的分析质量。本文使用 2018–2019 年美国国家标准与技术研究院公共安全通信研究(NIST PSCR)部门的“差分隐私合成数据挑战赛”中参赛者创建的真实差分隐私合成数据集,对若干差分隐私合成数据算法进行深度评估。我们基于其所创建数据的准确性及潜在数据提供者的可用性,对这些算法进行分析。我们将 NIST PSCR 数据挑战赛中使用的方法置于更广义的差分隐私合成数据文献框架中。我们在差分隐私合成数据上实施了额外的效用度量(包括我们自行提出的两个),并在三类上比较机制效用。我们对差分隐私数据合成方法与质量度量的比较评估展示了相对有用性、总体优势与弱点,并给出了算法与度量的优选。最后,我们描述了该评估对寻求在未来数据产品上实施差分隐私合成数据算法的政策制定者的启示。
引用
@article{arxiv.1911.12704,
title = {Comparative Study of Differentially Private Synthetic Data Algorithms from the NIST PSCR Differential Privacy Synthetic Data Challenge},
author = {Claire McKay Bowen and Joshua Snoke},
journal= {arXiv preprint arXiv:1911.12704},
year = {2020}
}
备注
32 pages (27 main, 5 references), 3 figures, 9 tables