中文

最终阶段瓶颈:对网络因果推断中 R-Learner 的系统性剖析

机器学习 2026-04-02 v3

摘要

R-Learner 是一个强大且在理论上有严谨依据的框架,用于估计异质处理效应,因其对误差模型的鲁棒性而备受推崇。然而,其应用于网络数据(其中因果异质性常取决于图结构)时,面临对其核心假设——即最终阶段模型需具备良好指定——的挑战。本文我们对 R-Learner 框架在图数据上的应用进行大规模实证研究,系统性剖析其工作原理。我们首次提供严谨的证据表明,性能的主要驱动因素是最终阶段 CATE 估计器的归纳偏置,此效果远超杂贮模型选择的影响。我们的核心发现是量化了一个惊人“表示瓶颈”:我们以显著低于 0.001 的 p 值证明,图数据中对 R-Learner 进行图结构不敏感的最终阶段建模会完全失效(MSE > 4.0),即使搭配强大的图神经网络杂贮模型。相比之下,我们提出的端到端图 R-Learner成功地显著优于强大的非 DML GNN T-Learner基线。此外,我们识别并提供了一种机制性解释,指出一种细微的、拓扑依赖的“杂贮瓶颈”,并通过针对性的“枢纽-外围权衡”分析将其与 GNN 过度压缩联系起来。我们的发现在多样化的合成和准合成基准上得到验证。我们发布了代码作为可复现的基准,以促进此关键“最终阶段瓶颈”的未来研究。

关键词

引用

@article{arxiv.2511.13018,
  title  = {The Final-Stage Bottleneck: A Systematic Dissection of the R-Learner for Network Causal Inference},
  author = {S Sairam and Sara Girdhar and Shivam Soni},
  journal= {arXiv preprint arXiv:2511.13018},
  year   = {2026}
}

备注

Published In TMLR 15 pages, 4 figures