中文

差分隐私合成类别数据的效用与披露风险

应用统计 2022-06-28 v2

摘要

本文介绍了两种创建差分隐私(DP)合成数据的方法,现已集成到 R 语言的 synthpop 包中。两者均适用于合成类别数据,或分组为类别的数值数据。我们使用十个具有不同特征的数据集来评估这些方法。定义并计算了披露性和效用的度量。第一种方法是对所有变量的交叉表添加 DP 噪声,并通过基于所得概率的多项抽样创建合成数据。虽然该方法确实降低了披露风险,但未能为任一数据集提供足够质量的合成数据。另一种方法是创建一组带噪声的边际分布,并通过迭代比例拟合算法使其相互一致,然后如上使用拟合概率。结果表明,在差分隐私参数 ϵ\epsilon 低至 0.5 时,该方法为大多数数据集提供了可用的合成数据。针对每个数据集展示了披露风险与 ϵ\epsilon 之间的关系。结果揭示了披露性与数据效用之间的权衡如何依赖于数据集的特征。

关键词

引用

@article{arxiv.2206.01362,
  title  = {Utility and Disclosure Risk for Differentially Private Synthetic Categorical Data},
  author = {Gillian M Raab},
  journal= {arXiv preprint arXiv:2206.01362},
  year   = {2022}
}