中文

利用公开数据进行癌症聚集调查的因果推断框架

统计方法学 2018-12-12 v2 应用统计

摘要

当高癌症率被注意到时,社区常常感到恐慌,居民怀疑这些癌症病例可能由已知的危害源引起。对此,CDC 建议卫生部门进行标准化发病比(SIR)分析,以确定观测到的癌症发病率是否高于预期。该方法具有文献中已有充分记载的若干局限。本文中我们提出一种植根于潜在结果框架的、用于癌症聚集调查的新因果推断方法。假设代表社区癌症率升高潜在原因的危害源事先已确定,我们引入称为因果 SIR(cSIR)的新估计量。cSIR 定义为暴露人群中的期望癌症发病率除以(反事实)无暴露情景下的期望癌症发病率之比。为估计 cSIR,我们需要克服两个主要挑战:1)识别与暴露人群尽可能相似的非暴露人群,以辅助无暴露反事实情景下的估计;2)利用公开可用数据对这些非暴露人群的癌症发病率进行推断,而这些数据在空间聚合水平上常远高于所需。我们借助匹配克服了第一个挑战;通过开发一个贝叶斯分层模型、借用其他来源信息以在所需更细空间聚合水平上插补癌症发病率,克服了第二个挑战。我们将所提方法应用于判定纽约州恩迪科特的三氯乙烯蒸气暴露是否导致了癌症发病率升高。

关键词

引用

@article{arxiv.1811.05997,
  title  = {A causal inference framework for cancer cluster investigations using publicly available data},
  author = {Rachel C. Nethery and Yue Yang and Anna J. Brown and Francesca Dominici},
  journal= {arXiv preprint arXiv:1811.05997},
  year   = {2018}
}