中文

失踪的故事:LLM 长篇故事生成中的一致性错误

计算与语言 2026-03-09 v1 人工智能

摘要

当讲故事的人忘记了自己的故事时会发生什么?大型语言模型(LLM)现在可以生成跨越数万字的叙事文本,但它们往往无法在整个过程中维持一致性。生成长篇叙事时,这些模型会矛盾其自身既定事实、人物性格和世界规则。现有的故事生成基准主要关注情节质量和流畅度,导致一致性错误基本未被探讨。为填补这一空白,我们提出 ConStory-Bench—a 用于评估长篇故事生成中叙事一致性的基准。其包含 2000 个跨越四个任务情景的提示,并定义了五大错误类别的 19 个细分子类。我们还开发了 ConStory-Checker—an 自动检测矛盾并将每个判断依据明确文本证据的管道。通过五个研究问题评估多种 LLM,我们发现一致性错误呈明显趋势:它们在事实和时间维度最常见,往往出现在叙事中段,发生在标记级熵值较高的文本片段中,且某些错误类型倾向于共现。这些发现可为未来改进长篇叙事生成中的一致性提供指导。我们的项目页面地址为 https://picrew.github.io/constory-bench.github.io/。

关键词

引用

@article{arxiv.2603.05890,
  title  = {Lost in Stories: Consistency Bugs in Long Story Generation by LLMs},
  author = {Junjie Li and Xinrui Guo and Yuhao Wu and Roy Ka-Wei Lee and Hongzhi Li and Yutao Xie},
  journal= {arXiv preprint arXiv:2603.05890},
  year   = {2026}
}