用于数据隐私保护的贝叶斯伪后验合成
统计理论
2020-05-19 v3 应用统计
统计方法学
统计理论
摘要
统计机构利用模型合成受访者级别的数据以发布给公众,作为实际数据记录的替代方案。贝叶斯模型合成器通过采用诱导实际数据分布平滑化的分层先验构造来编码隐私保护。由于研究人员和数据分析人员的多种可能用途,合成受访者级别的数据记录通常比汇总数据表更受青睐。机构在合成数据的效用与披露风险之间进行权衡,并在发布合成数据集之前设定披露风险的具体目标阈值。我们引入了一种伪后验似然,通过 (0, 1) 内的观测记录索引权重对每个贡献进行指数化,该权重定义为与合成数据中该记录的披露风险成反比。我们使用权重向量允许对高风险记录进行更精确的降权,与使用标量权重相比,能更好地保留效用。我们通过模拟研究和美国劳工统计局消费者支出调查的应用来说明我们的方法。我们演示了频率论一致性和不确定性量化如何受逆风险加权的影响。
引用
@article{arxiv.1901.06462,
title = {Bayesian Pseudo Posterior Synthesis for Data Privacy Protection},
author = {Jingchen Hu and Terrance D. Savitsky},
journal= {arXiv preprint arXiv:1901.06462},
year = {2020}
}
备注
This is to replace arXiv:1908.07639