中文

基于马尔可夫与贝叶斯网络的数据驱动混杂因素选择

统计方法学 2017-03-20 v2

摘要

为了无偏地估计对结果的因果效应,通常假设无混杂性(unconfoundedness)。如果对底层因果结构有充分知识,则可以使用现有的混杂因素选择标准来选择观测到的预处理协变量 XX 的子集,这些子集足以满足无混杂性(如果存在这样的子集)。本文考虑在底层因果结构未知时对这些目标子集的估计。所提出的方法是通过概率图模型(例如马尔可夫或贝叶斯网络)对因果结构建模,从观测数据估计该图,并基于估计的图选择目标子集。该方法通过模拟进行评估,模拟环境包括给定 XX 满足无混杂性的高维设置,以及仅给定 XX 的子集满足无混杂性的设置。研究了几种常见目标子集,并根据估计平均因果效应的准确性对所选子集进行比较。所提出的方法使用现有软件实现,可轻松处理大样本和大量协变量维度的高维数据。模拟研究结果表明,如果给定 XX 满足无混杂性,该方法在选择目标子集上非常成功,优于基于随机森林和LASSO的替代方法;并且估计包含结果所有原因的目标子集的子集在平均因果效应估计中产生最小的MSE。

关键词

引用

@article{arxiv.1604.07212,
  title  = {Data-Driven Confounder Selection via Markov and Bayesian Networks},
  author = {Jenny Häggström},
  journal= {arXiv preprint arXiv:1604.07212},
  year   = {2017}
}

备注

To appear in Biometrics