Linear-LLM-SCM:用于线性高斯因果模型系数诱导的 LLM 基准测试
机器学习
2026-02-12 v1
摘要
大型语言模型 (LLM) 在识别定性因果关系方面显示出潜力,但在连续域中进行定量因果推理——估计参数化函数关系的效应大小——方面仍受到 insufficient 探索。我们引入 Linear-LLM-SCM,一个即插即用的基准框架,用于评估 LLM 在给定 DAG 时的线性高斯结构因果模型 (SCM) 参数化能力。该框架将 DAG 分解为局部父子集合,并提示 LLM 为每个节点生成回归风格的结构方程,最终聚合并与可用的 ground-truth 参数进行比较。我们的实验显示,这类基准任务存在若干挑战,即结果中存在强随机性,且在连续域中对 DAG 误指定具有高度敏感性(例如引入虚假边)。在各种模型设置下,我们观察到系数估计值在某些情况下存在显著变异性,并对结构和语义扰动敏感,这突显了 LLM 作为定量因果参数化器的当前局限性。我们还开源了该基准框架,以便研究人员能够轻松地利用自己的 DAG 和任何可用的 LLM 进行评估。
引用
@article{arxiv.2602.10282,
title = {Linear-LLM-SCM: Benchmarking LLMs for Coefficient Elicitation in Linear-Gaussian Causal Models},
author = {Kanta Yamaoka and Sumantrak Mukherjee and Thomas Gärtner and David Antony Selby and Stefan Konigorski and Eyke Hüllermeier and Viktor Bengs and Sebastian Josef Vollmer},
journal= {arXiv preprint arXiv:2602.10282},
year = {2026}
}
备注
16 pages, 4 figures, preprint