中文

CARL-GT:评估大型语言模型因果推理能力

计算与语言 2024-12-25 v1 机器学习 统计方法学

摘要

因果推理能力对于大型语言模型 (LLMs) 在广泛应用中至关重要,如教育和医疗保健领域。但仍缺乏基准测试以更好地理解此类能力。当前 LLM 基准测试主要基于对话任务、学术数学测试和编码测试。此类基准测试在评估 LLMs 的 well-regularized 设置中起作用,但它们在评估解决实际问题的技能和能力方面受限。在本工作中,我们提供了一个名为 CARL-GT 的基准测试,用于使用图和表格数据评估大型语言模型的 CAusal Reasoning 能力。该基准测试涵盖了评估 LLMs 从因果图推理、知识发现和决策方面进行的多样化任务范围。此外,开发了用于该任务的有效零样本学习提示。在我们的实验中,我们利用该基准测试对开源 LLMs 进行评估,并对 LLMs 在因果推理能力方面进行详细比较。我们发现 LLMs 在因果推理方面仍然薄弱,特别是针对发现新见解的表格数据。此外,我们研究并讨论了不同基准任务之间的关系,通过分析 LLMs 的性能来实现。实验结果显示,LLMs 在不同任务上表现出不同的优势,并且其在不同类别任务中的表现,即因果图推理、知识发现和决策,显示出比同一类别内的任务更强的相关性。

关键词

引用

@article{arxiv.2412.17970,
  title  = {CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models},
  author = {Ruibo Tu and Hedvig Kjellström and Gustav Eje Henter and Cheng Zhang},
  journal= {arXiv preprint arXiv:2412.17970},
  year   = {2024}
}