记忆 $\neq$ 理解:大型语言模型具备场景认知能力吗?
计算与语言
2025-09-08 v1
摘要
在海量且多样化的文本数据驱动下,大型语言模型在众多自然语言处理任务中展现出了令人瞩目的性能。然而,一个关键问题依然存在:它们的泛化能力是仅仅源于对训练数据的记忆,还是源于深层的语义理解?为了研究这一问题,我们提出了一个双视角评估框架来评估 LLM 的场景认知——即将语义场景元素与其在上下文中的论元相关联的能力。具体而言,我们引入了一个新颖的基于场景的数据集,包含对虚构事实的多样化文本描述,并标注了场景元素。我们通过 LLM 回答场景相关问题的能力(模型输出视角)以及探测其内部表征中编码的场景元素-论元关联(内部表征视角)来对其进行评估。我们的实验表明,当前的 LLM 主要依赖表层记忆,未能实现稳健的语义场景认知,即使在简单情况下也是如此。这些发现揭示了 LLM 在语义理解方面的关键局限性,并为提升其能力提供了认知层面的启示。
引用
@article{arxiv.2509.04866,
title = {Memorization $\neq$ Understanding: Do Large Language Models Have the Ability of Scenario Cognition?},
author = {Boxiang Ma and Ru Li and Yuanlong Wang and Hongye Tan and Xiaoli Li},
journal= {arXiv preprint arXiv:2509.04866},
year = {2025}
}
备注
EMNLP 2025 Main Conference