中文

NarrationBench:面向叙事理解任务的全面基准框架

计算与语言 2025-12-02 v3 人工智能

摘要

我们提出 NarraBench,这是一个基于理论的叙事理解任务分类法,以及相关的 78 个现有基准的调查。我们发现,当前基准中显著缺乏覆盖叙事理解方面的评估,或者这些评估与现有指标不够匹配。具体而言,我们估计只有 27% 的叙事任务能被现有基准很好地覆盖,我们注意到包括叙事事件、风格、视角和揭示等领域在内的一些区域几乎不存在于当前评估中。我们还指出,需要开发更多能够评估本质上具有主观性和视角性方面的基准,即这些方面通常没有唯一正确答案。我们的分类、调查和方法论对寻求测试 LLM 叙事理解能力的 NLP 研究者具有重要价值。

关键词

引用

@article{arxiv.2510.09869,
  title  = {NarraBench: A Comprehensive Framework for Narrative Benchmarking},
  author = {Sil Hamilton and Matthew Wilkens and Andrew Piper},
  journal= {arXiv preprint arXiv:2510.09869},
  year   = {2025}
}