发现有瑕疵的虚构故事:通过情节漏洞检测评估语言模型的复杂推理
计算与语言
2025-12-19 v3
摘要
故事是人类体验的基本方面。深入地与故事互动并发现情节漏洞——打破故事内部逻辑或其世界规则的不一致——需要精细的推理技能,包括跟踪实体和事件及其相互作用、抽象思维、实用叙事理解、常识和社交推理,以及理论心智。随着大语言模型 (LLM) 越来越多地生成、解释和修改文本,严格评估其叙事一致性和更深层的语言理解变得至关重要。然而,现有基准主要关注表层理解。在本工作中,我们将情节漏洞检测作为评估 LLM 情节理解和推理的代理指标。我们提出了 FlawedFictionsMaker,一种可控且严谨地合成故事情节漏洞的算法。使用该算法,我们构建了一个评估 LLM 在故事中情节漏洞检测能力的基准——FlawedFictions——该基准对污染具有鲁棒性,人工筛选确保了高质量。我们发现,无论允许的推理投入如何,最先进的 LLM 在准确解决 FlawedFictions 方面都面临挑战,随着故事长度的增加,性能显著下降。最后,我们表明 LLM 基于的故事摘要和故事生成容易引入情节漏洞,相对于人类原作,情节漏洞检测率分别增加了 50\% 和 100\%。
引用
@article{arxiv.2504.11900,
title = {Finding Flawed Fictions: Evaluating Complex Reasoning in Language Models via Plot Hole Detection},
author = {Kabir Ahuja and Melanie Sclar and Yulia Tsvetkov},
journal= {arXiv preprint arXiv:2504.11900},
year = {2025}
}
备注
CoLM 2025 Camera Ready