超越数学:故事作为LLM中记忆约束推理的测试平台
计算与语言
2026-04-28 v6
摘要
最近,大语言模型(LLM)在角色理解任务(如分析虚构角色的角色、个性和关系)中表现出色。然而,LLM使用的大量预训练语料库引发担忧,即它们可能依赖于记忆流行虚构作品,而非真正理解和推理它们。在本文中,我们认为“要点记忆”——捕捉本质含义——应该是角色理解任务的主要机制,而不是“逐字记忆”——字符串的精确匹配。我们引入了一种简单而有效的方法,以减轻角色理解评估中的机械化记忆,同时保留理解和推理所需的基本隐式线索。我们的方法将流行虚构作品上由记忆驱动的性能从96%的准确率降低到72%,并在各种角色理解任务中导致高达18%的准确率下降。这些发现强调了现有基准测试中的数据污染问题,这些基准测试通常衡量的是记忆而非真正的角色理解。
引用
@article{arxiv.2412.14368,
title = {Beyond Math: Stories as a Testbed for Memorization-Constrained Reasoning in LLMs},
author = {Yuxuan Jiang and Francis Ferraro},
journal= {arXiv preprint arXiv:2412.14368},
year = {2026}
}
备注
published on EACL 2026 Main