中文

合成数据的一般与特定效用度量

应用统计 2017-06-20 v2

摘要

数据持有者可在对潜在披露风险的担忧限制原始记录可用性的情况下,生成数据集的合成版本。本文关注判断此类合成数据是否具有与原始数据相当的分布的方法,我们称之为一般效用。我们考虑一般效用与特定效用的比较,后者指合成数据与原始数据分析结果的相似性。我们将先前的一种通用数据效用度量——倾向得分均方误差(propensity score mean-squared-error, pMSE)——改造用于合成数据的特定情形,并推导了在使用正确合成模型生成合成数据时的分布。我们的渐近结果通过模拟研究得到验证。我们还考虑了两种特定效用度量,即置信区间重叠与汇总统计的标准化差异,并将其与一般效用结果进行比较。我们给出两个实例,检验这种一般与特定效用在真实数据合成中的比较,并为其在评估合成数据时的使用提出建议。

关键词

引用

@article{arxiv.1604.06651,
  title  = {General and specific utility measures for synthetic data},
  author = {Joshua Snoke and Gillian Raab and Beata Nowok and Chris Dibben and Aleksandra Slavkovic},
  journal= {arXiv preprint arXiv:1604.06651},
  year   = {2017}
}