当代因果推断模型是否捕捉到了真实世界的异质性?大规模基准测试的发现
机器学习
2025-02-21 v2 机器学习
摘要
我们呈现了来自大规模基准测试的意外发现,该测试评估了条件平均处理效应 (CATE) 估计算法,即 CATE 模型。通过在 12 个数据集上运行 16 个现代 CATE 模型,并通过多样化的观察性抽样策略生成 43,200 个抽样变体,我们发现:(a) 62% 的 CATE 估计的均方误差 (MSE) 高于一个平凡的零效应预测器,因而无效;(b) 在至少有一个有用 CATE 估计的数据集中,80% 仍高于常数效应模型;(c) 尽管对其性能持广泛乐观看法,正交性基于的模型仅在 30% 的情况下获胜。这些发现凸显了当前 CATE 模型中的重大挑战,强调需要更广泛的评估和方法学改进的必要性。我们的发现源于一种新颖的观察性抽样应用,最初是为了评估来自观察方法的平均处理效应 (ATE) 估计与实验数据的比较。为了将观察性抽样用于 CATE 评估,我们引入了一个统计参数 ,等于 MSE 减去一个常数,并保持模型按其 MSE 排序的顺序。随后,我们派生出一系列样本统计量,统称为 ,可从真实数据中计算得出。在观察性抽样中使用时, 是 的无偏估计量,并渐近地选择 MSE 最小的模型。为确保基准测试反映真实世界的异质性,我们精选了其中结果来自现场而非仿真的数据集。通过整合观察性抽样、新统计量和真实数据集,基准测试提供了关于 CATE 模型性能的新见解,并揭示了捕捉真实世界异质性方面的差距,强调需要更稳健的基准测试。
引用
@article{arxiv.2410.07021,
title = {Do Contemporary Causal Inference Models Capture Real-World Heterogeneity? Findings from a Large-Scale Benchmark},
author = {Haining Yu and Yizhou Sun},
journal= {arXiv preprint arXiv:2410.07021},
year = {2025}
}