合成数据与微观数据样本在效用与披露风险上的比较
密码学与安全
2022-07-08 v1 机器学习
摘要
大多数统计机构发布随机抽选的普查微观数据样本,通常样本比例低于10%,并施加其他形式的统计披露控制(SDC)。SDC的一种替代方案是数据合成,其正吸引日益增长的兴趣,然而对于如何度量数据的相应效用与披露风险尚无明确共识。若能生成效用与相关风险均被清晰理解的合成普查微观数据,则可能实现对微观数据更及时、更广泛的访问。本文延续作者先前将合成普查数据映射于风险-效用(R-U)图上的工作。论文提出一个框架,通过将合成数据与不同样本比例的原始数据样本进行比较来度量其效用与披露风险,从而识别出与合成数据具有等效效用与风险的样本比例。三个常用的数据合成包被比较,得到了一些有趣结果。若干方向尚需进一步工作,但该方法论看来极具前景。
引用
@article{arxiv.2207.03339,
title = {Comparing the Utility and Disclosure Risk of Synthetic Data with Samples of Microdata},
author = {Claire Little and Mark Elliot and Richard Allmendinger},
journal= {arXiv preprint arXiv:2207.03339},
year = {2022}
}