基于逐检验删除的非随机缺失快速因果推断
统计方法学
2017-05-26 v1 机器学习
摘要
许多真实数据集包含非随机缺失(MNAR)的值。在这种情况下,研究者通常在应用因果发现算法之前执行列表式删除,即删除任何含有缺失值的样本。当与 FCI 和 RFCI 等算法配合使用时,列表式删除是一种可靠且通用的策略,但该删除过程也剔除了那些仅包含少量缺失值的良好样本。在本报告中,我们展示了可以通过逐检验删除更有效地利用观测值,同时仍保持算法的可靠性。这里,逐检验删除指的是仅在基于约束的搜索所使用的每个条件独立性(CI)检验所需的变量中列表式删除样本的过程。因此,逐检验删除通常比列表式删除为每个 CI 检验保留更多样本,尤其是在底层图稀疏的情况下。我们的理论结果表明,在缺失机制在底层因果图中互不因果影响的合理假设下,逐检验删除是可靠的。我们还发现,在合成数据和真实数据中均存在 MNAR 的情况下,采用逐检验删除的 FCI 和 RFCI 平均而言优于其列表式删除和插补的对应方法。
引用
@article{arxiv.1705.09031,
title = {Fast Causal Inference with Non-Random Missingness by Test-Wise Deletion},
author = {Eric V. Strobl and Shyam Visweswaran and Peter L. Spirtes},
journal= {arXiv preprint arXiv:1705.09031},
year = {2017}
}