CausalReasoningBenchmark:用于解耦因果识别与估计的真实世界基准
人工智能
2026-05-15 v2
摘要
许多用于自动因果推断的基准测试仅基于单一数值输出(如平均处理效应,ATE)来评估系统性能。这一方法混合了因果分析中的两个 distinct 步骤:identification —— 在给定假设下制定有效的研究设计 —— 与 estimation —— 在有限数据上对该设计进行数值实现。我们引入 CausalReasoningBenchmark,这是一个包含 173 个查询、涵盖 132 个真实世界数据集的基准测试,数据来源于 79 篇同行评审论文和三本广泛使用的因果推断教材。对于每个查询,系统需分别输出 (i) 指明策略、处理、结果和控制变量以及所有设计要素的结构化 identification 规范,以及 (ii) 带标准误的点估计。通过独立评分这两个组成部分,本基准实现粒度诊断:区分因果推理中的错误与数值执行中的错误。基于最先进 LLM 的基线结果显示,模型在 79% 的案例中正确识别高层次策略,但完整 identification 规范的正确性仅为 34%,揭示了瓶颈在于研究设计细节而非计算。CausalReasoningBenchmark 已公开于 Hugging Face,旨在推动更稳健的自动因果推断系统的开发。
引用
@article{arxiv.2602.20571,
title = {CausalReasoningBenchmark: A Real-World Benchmark for Disentangled Evaluation of Causal Identification and Estimation},
author = {Ayush Sawarni and Jiyuan Tan and Vasilis Syrgkanis},
journal= {arXiv preprint arXiv:2602.20571},
year = {2026}
}