中文

利用大规模倾向得分调整间接测量的混杂因素

统计方法学 2024-01-10 v3 应用统计

摘要

混杂仍是观测数据因果推断的主要挑战之一。该问题在医学中尤为突出,我们希冀从电子健康记录(EHRs)和行政理赔等大型观测数据集中回答因果问题。现代医学数据通常包含数万协变量。如此庞大的集合带来希望:许多混杂因素被直接测量,并进一步希望其他混杂因素通过其与被测协变量的相关性被间接测量。我们如何利用这些大型协变量集进行因果推断?为助回答此问,本文考察了大规模倾向得分(LSPS)方法在医学数据因果分析中的表现。我们证明 LSPS 可通过纳入数万可能与之相关的协变量来调整间接测量的混杂因素。我们给出了 LSPS 消除由间接测量混杂因素所致偏倚的条件,并表明 LSPS 可在无意中调整(如碰撞节点等)否则会引入偏倚的变量时避免偏倚。我们通过模拟医学数据与真实医学数据展示了 LSPS 的表现。

关键词

引用

@article{arxiv.2110.12235,
  title  = {Adjusting for indirectly measured confounding using large-scale propensity scores},
  author = {Linying Zhang and Yixin Wang and Martijn Schuemie and David Blei and George Hripcsak},
  journal= {arXiv preprint arXiv:2110.12235},
  year   = {2024}
}