中文

InterveneBench:面向干预推理与社会系统因果研究设计的LLM基准

计算机与社会 2026-03-17 v1 人工智能

摘要

因果推理在社会科学中依赖于以干预为中心的端到端研究设计推理,建立在真实政策干预之上,但当前基准测试未能评估大型语言模型(LLM)的这一能力。我们提出InterveneBench,用于评估在真实社会情境下的此类推理能力。InterveneBench中的每个实例都源自实证社会科学研究,要求模型就政策干预和识别假设进行推理,而无需访问预定义的因果图或结构方程。InterveneBench涵盖744个不同政策领域的同行评议研究。实验结果表明,当前最先进的LLM在此设置下表现不佳。为此,我们进一步提出了一个多智能体框架STRIDES。它在当前最先进推理模型之上取得了显著的性能提升。我们的代码和数据已公开于https://github.com/Sii-yuning/STRIDES。

关键词

引用

@article{arxiv.2603.15542,
  title  = {InterveneBench: Benchmarking LLMs for Intervention Reasoning and Causal Study Design in Real Social Systems},
  author = {Shaojie Shi and Zhengyu Shi and Lingran Zheng and Xinyu Su and Anna Xie and Bohao Lv and Rui Xu and Zijian Chen and Zhichao Chen and Guolei Liu and Naifu Zhang and Mingjian Dong and Zhuo Quan and Bohao Chen and Teqi Hao and Yuan Qi and Yinghui Xu and Libo Wu},
  journal= {arXiv preprint arXiv:2603.15542},
  year   = {2026}
}

备注

35pages,3 figures