大语言模型在进行因果推断时是否具备泛化能力?
计算与语言
2024-10-16 v1
摘要
在因果推断中,泛化能力指的是能够对新数据进行因果推断方法,以估计未知现象之间的因果效应,这对于扩展知识的边界至关重要。已有研究评估了大语言模型(LLMs)在已知现象下的因果推断能力,但尚未探讨 LLMs 在未知现象下的泛化能力。在本文中,我们选取四个任务:因果路径发现(CP)、信道调整(BA)、事实推断(FI)和反事实推断(CI),作为因果推断任务的代表。为生成关于先前未见过的现象在新数据中的问题,我们提出一种基准生成框架,该框架采用随机生成的图和节点名称,以假设性的新因果情景形式提出问题。基于此框架,我们构建了一个不同问题复杂度水平的基准数据集。我们广泛测试了五个领先的 LLMs 在四个任务上的泛化能力。实验结果显示,尽管 LLMs 在解答简单 CP、FI 和复杂 CI 题目时表现良好,但在解决 BA 题目时遇到了困难,并且在问题复杂度变化时面临显著性能波动。此外,即使现象名称包含现有的术语,即使这些名称本是全新创造的,其泛化性能仍可能因熟悉术语的干扰而受到影响。
引用
@article{arxiv.2410.11385,
title = {Do LLMs Have the Generalization Ability in Conducting Causal Inference?},
author = {Chen Wang and Dongming Zhao and Bo Wang and Ruifang He and Yuexian Hou},
journal= {arXiv preprint arXiv:2410.11385},
year = {2024}
}