中文

基于逐检验删除的非随机缺失快速因果推断

统计方法学 2017-05-26 v1 机器学习

摘要

许多真实数据集包含非随机缺失(MNAR)的值。在这种情况下,研究者通常在应用因果发现算法之前执行列表式删除,即删除任何含有缺失值的样本。当与 FCI 和 RFCI 等算法配合使用时,列表式删除是一种可靠且通用的策略,但该删除过程也剔除了那些仅包含少量缺失值的良好样本。在本报告中,我们展示了可以通过逐检验删除更有效地利用观测值,同时仍保持算法的可靠性。这里,逐检验删除指的是仅在基于约束的搜索所使用的每个条件独立性(CI)检验所需的变量中列表式删除样本的过程。因此,逐检验删除通常比列表式删除为每个 CI 检验保留更多样本,尤其是在底层图稀疏的情况下。我们的理论结果表明,在缺失机制在底层因果图中互不因果影响的合理假设下,逐检验删除是可靠的。我们还发现,在合成数据和真实数据中均存在 MNAR 的情况下,采用逐检验删除的 FCI 和 RFCI 平均而言优于其列表式删除和插补的对应方法。

关键词

引用

@article{arxiv.1705.09031,
  title  = {Fast Causal Inference with Non-Random Missingness by Test-Wise Deletion},
  author = {Eric V. Strobl and Shyam Visweswaran and Peter L. Spirtes},
  journal= {arXiv preprint arXiv:1705.09031},
  year   = {2017}
}