TMLE 因果效应估计:处理缺失数据与接近违反正性条件
统计方法学
2026-05-12 v1 机器学习
摘要
我们评估了在缺失数据情景下,对平均处理效应进行受限最大似然估计 (TMLE) 的性能。我们采用模型和基于设计的仿真,其中后者使用欠平滑的高度自适应套索在 'WASH Benefits Bangladesh' 数据集上,以模拟真实世界的复杂性。考虑五种缺失性指向的无环图,捕捉流行病学研究中常见的缺失数据机制,特别是单一暴露研究中的机制。这些机制包括暴露、结果和混杂变量中的非随机缺失。我们比较了八种缺失数据方法,结合 TMLE 作为分析方法,区分非多重插补 (非 MI) 和多重插补 (MI) 方法。MI 方法使用参数化和机器学习模型。结果表明,非 MI 方法,特别是结合包含结果缺失模型的完整案例法, exhibit 较低偏差,并在正性违反情况下的鲁棒性更强。在比较 MI 使用分类回归树 (CART) 的方法时,实现更低的均方根误差,同时通常保持名义覆盖率。我们的发现突显了偏差与覆盖率之间的权衡,并建议在降低偏差方面使用完整案例法结合包含结果缺失模型的 TMLE,在获得准确置信区间时使用 MI CART。
引用
@article{arxiv.2510.22202,
title = {Causal Effect Estimation with TMLE: Handling Missing Data and Near-Violations of Positivity},
author = {Christoph Wiederkehr and Christian Heumann and Michael Schomaker},
journal= {arXiv preprint arXiv:2510.22202},
year = {2026}
}
备注
35 Pages, 7 Figures