利用饱和计数模型对用户友好的分类数据合成
统计方法学
2022-05-13 v2
摘要
在过去三十年中,用于统计披露控制的合成数据方法不断发展,但主要局限于调查数据集领域。行政数据库具有某些特征,例如其规模,从合成角度提出了挑战并需要特别关注。本文通过拟合饱和计数模型,提出了一种适用于行政数据库、由两个参数调节的合成方法。该方法允许快速合成大型分类数据集,并允许在合成数据生成之前即先验地满足风险与效用度量。本文探讨了双参数计数模型(负二项分布与泊松-逆高斯分布)所提供的灵活性如何被用于保护合成数据中受访者——尤其是唯一记录者(uniques)——的隐私。最后,通过对一个可视为英国学校普查良好替代品的数据库进行合成,给出了实证示例。
引用
@article{arxiv.2107.08062,
title = {Using saturated count models for user-friendly synthesis of categorical data},
author = {James Edward Jackson and Robin Mitra and Brian Joseph Francis and Iain Dove},
journal= {arXiv preprint arXiv:2107.08062},
year = {2022}
}
备注
37 pages, 6 figures