用于隐私保护的风险高效贝叶斯数据合成
统计方法学
2022-06-02 v6 应用统计
摘要
统计机构利用模型合成受访者级别数据并公开发布以实现隐私保护。本工作中,我们通过采用伪似然,将隐私保护高效地引入任意贝叶斯合成模型;该伪似然将每个似然贡献以记录索引的权重[0, 1]做指数化,该权重定义为与该记录识别风险成反比。我们从记录的边际识别风险概率出发,其构成为该记录身份可能被披露的概率。我们对美国劳工统计局消费者支出调查(CE)的应用表明,边际风险调整合成器提供了整体改进的隐私保护;然而,在风险调整伪后验估计合成后,由于加权后隔离度增加,部分中等风险记录的识别风险实际上上升了,我们将此现象称为“打地鼠”。我们进一步从记录与其他记录的成对识别风险概率集合中为每个记录构造权重,其中每个成对概率度量该对记录再识别的联合概率,这缓解了打地鼠问题,并为CE数据生成了风险更低、效用更高的更高效合成数据集。
引用
@article{arxiv.1908.07639,
title = {Risk-Efficient Bayesian Data Synthesis for Privacy Protection},
author = {Jingchen Hu and Terrance D. Savitsky and Matthew R. Williams},
journal= {arXiv preprint arXiv:1908.07639},
year = {2022}
}