使用 $\texttt{IdentificationRiskCalculation}$ R 包评估部分合成数据的重识别风险
统计方法学
2021-04-07 v4 应用统计
摘要
我们扩展了一种评估部分合成数据中合成变量重识别风险的通用方法。对于多个连续合成变量,我们引入了在构建每个目标记录的重识别风险概率时使用半径 的方法,并通过工作示例进行了说明。我们创建了 R 包,以帮助研究人员和数据发布者执行这些重识别风险评估计算。我们通过该 R 包演示了我们的方法,并将其应用于消费者支出调查的数据样本,同时讨论了以下因素对风险和数据效用的影响:1) 半径 的选择,2) 合成变量的选择,以及 3) 合成数据集数量的选择。我们为统计机构合成和评估连续变量的重识别风险提供了建议。
引用
@article{arxiv.2006.01298,
title = {Identification Risks Evaluation of Partially Synthetic Data with the $\texttt{IdentificationRiskCalculation}$ R Package},
author = {Ryan Hornby and Jingchen Hu},
journal= {arXiv preprint arXiv:2006.01298},
year = {2021}
}
备注
16 pages with 10 figures