差分隐私数据合成方法的比较研究
统计方法学
2020-07-01 v4
摘要
当在研究人员之间共享数据或发布数据供公众使用时,存在暴露数据集中个人敏感信息的风险。数据合成(DS, Data synthesis)是一种用于发布带有伪个体记录的合成数据集的统计披露限制技术。传统 DS 技术通常依赖于对数据入侵者行为和背景知识的强假设来评估披露风险。差分隐私(DP, Differential privacy)提出了一种理论方法,用于在数据发布中提供强大且鲁棒的隐私保证,而无需对入侵者行为建模。已有一些努力旨在将 DP 概念纳入 DS 过程。在本文中,我们考察了当前用于发布原始数据个体级替代数据的差分隐私数据合成(DIPS, DIfferentially Private Data Synthesis)技术,从概念上比较这些技术,并通过广泛的模拟研究通过每种 DIPS 技术评估合成数据的统计效用和推断性质。我们的工作阐明了各种 DIPS 方法的实际可行性和效用,并提出了 DIPS 的未来研究方向。
引用
@article{arxiv.1602.01063,
title = {Comparative Study of Differentially Private Data Synthesis Methods},
author = {Claire McKay Bowen and Fang Liu},
journal= {arXiv preprint arXiv:1602.01063},
year = {2020}
}
备注
The main paper is the first 48 pages (8 pages of reference). The rest of the pages (49 - 67) contain the Supplemental Material