中文

记忆 $\neq$ 理解:大型语言模型具备场景认知能力吗?

计算与语言 2025-09-08 v1

摘要

在海量且多样化的文本数据驱动下,大型语言模型在众多自然语言处理任务中展现出了令人瞩目的性能。然而,一个关键问题依然存在:它们的泛化能力是仅仅源于对训练数据的记忆,还是源于深层的语义理解?为了研究这一问题,我们提出了一个双视角评估框架来评估 LLM 的场景认知——即将语义场景元素与其在上下文中的论元相关联的能力。具体而言,我们引入了一个新颖的基于场景的数据集,包含对虚构事实的多样化文本描述,并标注了场景元素。我们通过 LLM 回答场景相关问题的能力(模型输出视角)以及探测其内部表征中编码的场景元素-论元关联(内部表征视角)来对其进行评估。我们的实验表明,当前的 LLM 主要依赖表层记忆,未能实现稳健的语义场景认知,即使在简单情况下也是如此。这些发现揭示了 LLM 在语义理解方面的关键局限性,并为提升其能力提供了认知层面的启示。

关键词

引用

@article{arxiv.2509.04866,
  title  = {Memorization $\neq$ Understanding: Do Large Language Models Have the Ability of Scenario Cognition?},
  author = {Boxiang Ma and Ru Li and Yuanlong Wang and Hongye Tan and Xiaoli Li},
  journal= {arXiv preprint arXiv:2509.04866},
  year   = {2025}
}

备注

EMNLP 2025 Main Conference