中文

贝叶斯数据合成与披露风险量化:在消费者支出调查中的应用

应用统计 2021-02-03 v2

摘要

发布由基于数据估计的模型生成的合成数据,有助于统计机构以高效用与隐私保护 disseminate 受访者层面数据。受美国劳工统计局消费者支出调查(CE)中发布含地理信息的敏感变量这一挑战的推动,我们提出两个非参数贝叶斯模型作为每条数据记录的县标识符的数据合成器:一个贝叶斯潜类模型与一个贝叶斯面域模型。两个数据合成器均使用狄利克雷过程先验对相似特征的观测进行聚类,并允许跨观测借用信息。我们开发了创新的披露风险度量,以量化 CE 保密数据中的固有风险,以及我们提出的合成器如何缓解这些数据风险。通过在最小与最大披露风险情景下分别建立披露风险的下界与上界,我们提出的固有风险度量提供了一系列可接受的披露风险,用于评估合成数据集中的风险水平。

关键词

引用

@article{arxiv.1809.10074,
  title  = {Bayesian Data Synthesis and Disclosure Risk Quantification: An Application to the Consumer Expenditure Surveys},
  author = {Jingchen Hu and Terrance D. Savitsky},
  journal= {arXiv preprint arXiv:1809.10074},
  year   = {2021}
}