LLM因果理解:不确定性的作用
计算与语言
2025-09-25 v1 人工智能
摘要
近期研究表明,LLM在因果关系分类方面的准确率接近随机水平,这引发了疑问:这种失败是源于有限的预训练暴露,还是源于更深层的表征缺口。我们通过基于不确定性的评估来调查此问题,测试是否预训练期间对因果示例的暴露可提高因果理解。在18K篇PubMed句子中进行测试——一半来自The Pile语料库,一半来自2024年之后——针对七个模型(Pythia-1.4B/7B/12B、GPT-J-6B、Dolly-7B/12B、Qwen-7B)进行分析。我们通过以下方式分析模型行为:(i) 因果分类,其中模型识别文本中的因果关系,和(ii) 逐字记忆探测,其中我们评估模型是否偏好选择之前看到的因果语句而非其改写版本。结果显示,几乎相同的准确率在看到的和未看到的句子之间(p > 0.05),无记忆偏差(24.8%原句选择),以及输出分布在可能的选项上几乎是平坦的,熵值接近最大值(1.35/1.39),确认随机猜测。在指令调优模型中显示出严重的误校准(Qwen:>95%置信度,32.8%准确率,ECE=0.49)。条件关系引起最高的熵(相对于直接关系高出11%)。这些发现表明,因果理解的失败源于缺乏结构化的因果表征,而非预训练期间对因果示例的暴露不足。
引用
@article{arxiv.2509.20088,
title = {Causal Understanding by LLMs: The Role of Uncertainty},
author = {Oscar Lithgow-Serrano and Vani Kanjirangat and Alessandro Antonucci},
journal= {arXiv preprint arXiv:2509.20088},
year = {2025}
}
备注
Accepted in second UncertaiNLP workshop at EMNLP 2025