中文

贝叶斯数据合成与混合流行病学数据的效用-风险权衡

统计方法学 2022-01-20 v5

摘要

许多用于流行病学研究的微观数据包含真实个体的敏感测量值。因此,出于隐私考虑,此类微观数据无法公开发布,使得基于它们的任何已发表统计分析几乎无法被复现。为促进关键数据集的分析传播而不危及个体隐私,我们引入了一个连贯的贝叶斯框架,用于生成由混合分类、二值、计数和连续变量组成的全合成高维微观数据集。该过程围绕一个同时兼容所有这些数据类型的联合贝叶斯模型展开,从而能够通过后验预测抽样创建混合合成数据集。此外,流行病学数据分析的一个焦点是通过回归分析研究各种暴露因素与关键结局变量之间的条件关系。我们设计了一种改进的数据合成策略,以针对性地保留这些条件关系,包括非线性和交互作用。所提出的技术被用于创建一份保密数据集的合成版本,该数据集包含近 20,000 名北卡罗来纳州儿童的数十项健康、认知和社会测量值。

关键词

引用

@article{arxiv.2102.08255,
  title  = {Bayesian Data Synthesis and the Utility-Risk Trade-Off for Mixed Epidemiological Data},
  author = {Joseph Feldman and Daniel Kowal},
  journal= {arXiv preprint arXiv:2102.08255},
  year   = {2022}
}

备注

24 pages, 4 figures, 3 tables, accepted The Annals of Applied Statistics