LLMs 在叙事性语境中的时序意义理解:基于认知评估的案例研究
计算与语言
2025-12-01 v1
摘要
大语言模型(LLMs)展现出日益复杂的语言能力,但这些行为是人类类似认知还是高级模式识别尚未明确。在本研究中,我们探讨了 LLMs 处理语言方面时序意义的方式,这些叙事曾用于人类研究。我们采用 Expert-in-the-Loop probing pipeline,开展一系列针对性实验,以评估 LLMs 是否以人类方式构建语义表示和语用推断。我们的发现表明,LLMs 过度依赖原型性思维,产生不一致的方面判断,难以处理从方面派生的因果推理,这引发对其是否完全理解叙事的担忧。这些结果表明,LLMs 对方面的处理方式根本不同于人类,缺乏稳健的叙事理解能力。除了这些实证发现之外,我们开发了一个用于可靠评估 LLMs 认知和语言能力的标准化实验框架。
引用
@article{arxiv.2507.14307,
title = {How LLMs Comprehend Temporal Meaning in Narratives: A Case Study in Cognitive Evaluation of LLMs},
author = {Karin de Langis and Jong Inn Park and Andreas Schramm and Bin Hu and Khanh Chi Le and Michael Mensink and Ahn Thu Tong and Dongyeop Kang},
journal= {arXiv preprint arXiv:2507.14307},
year = {2025}
}