Mary, cheeseburger-eatin 素食者:大语言模型是否识别叙事中的不连贯性?
计算与语言
2025-12-09 v1
摘要
利用配对叙事数据集,我们探讨了大语言模型(LLMs)可靠分离不连贯与连贯叙事的能力。探针性研究发现,LLMs的内部表示能够可靠地识别不连贯的叙事。然而,LLMs生成的评级问题响应未能令人满意地区分连贯与不连贯的叙事,尽管经过多种提示变体测试,这表明了LLMs对叙事理解存在差距。测试的推理LLMs并未消除这些缺陷,表明思考链可能无法完全弥补模型内部状态与行为之间的差距。此外,我们发现LLMs对由违反场景设定的事件导致的不连贯(例如,沙漠中的雨天)比由角色违反既定性格特征导致的不连贯(例如,素食者Mary后来点了 cheeseburger)更敏感,这表明LLMs可能更依赖原型世界知识,而非建立基于意义的叙事连贯性。我们结果中发现的持续性不对称性表明,LLMs尚未完全把握叙事连贯性。
引用
@article{arxiv.2512.07777,
title = {Mary, the Cheeseburger-Eating Vegetarian: Do LLMs Recognize Incoherence in Narratives?},
author = {Karin de Langis and Püren Öncel and Ryan Peters and Andrew Elfenbein and Laura Kristen Allen and Andreas Schramm and Dongyeop Kang},
journal= {arXiv preprint arXiv:2512.07777},
year = {2025}
}