NarrationBench:面向叙事理解任务的全面基准框架
计算与语言
2025-12-02 v3 人工智能
摘要
我们提出 NarraBench,这是一个基于理论的叙事理解任务分类法,以及相关的 78 个现有基准的调查。我们发现,当前基准中显著缺乏覆盖叙事理解方面的评估,或者这些评估与现有指标不够匹配。具体而言,我们估计只有 27% 的叙事任务能被现有基准很好地覆盖,我们注意到包括叙事事件、风格、视角和揭示等领域在内的一些区域几乎不存在于当前评估中。我们还指出,需要开发更多能够评估本质上具有主观性和视角性方面的基准,即这些方面通常没有唯一正确答案。我们的分类、调查和方法论对寻求测试 LLM 叙事理解能力的 NLP 研究者具有重要价值。
引用
@article{arxiv.2510.09869,
title = {NarraBench: A Comprehensive Framework for Narrative Benchmarking},
author = {Sil Hamilton and Matthew Wilkens and Andrew Piper},
journal= {arXiv preprint arXiv:2510.09869},
year = {2025}
}