ExpliCa:评估大语言模型中的显式因果推理
泛函分析
2025-04-10 v2
摘要
大语言模型(LLM)在需要解释性和推理准确性的任务中日益受到关注。本文引入 ExpliCa,一个用于评估 LLM 显式因果推理的新数据集。ExpliCa 独特地整合了在不同语言顺序中呈现的因果和时间关系,并通过语言连接词显式表达。数据集配备了众多众包的人类可接受性评分。我们通过提示和困惑度基准方法对 LLM 进行了 ExpliCa 测试。我们评估了七个商业和开源 LLM,发现即便是最强模型也难以达到 0.80 的准确率。有趣的是,模型倾向于将时间关系与因果关系混淆,其表现也受到事件语言顺序的强烈影响。最后,困惑度得分和提示下的表现在模型规模方面存在差异。
引用
@article{arxiv.2502.15486,
title = {Tauberian theorems for sequences and the Katznelson--Tzafriri theorem},
author = {Andrew K. J. Pritchard and David Seifert},
journal= {arXiv preprint arXiv:2502.15486},
year = {2025}
}
备注
Accepted for publication in the IWOTA 2024 proceedings