中文

评估长篇故事的关键因素:大型长篇故事评估的系统性研究

计算与语言 2025-12-16 v1

摘要

本 work聚焦于一个具有挑战性的领域:书籍长度故事(>100K tokens)的自动评估。我们的研究关注两个关键问题:(1)理解哪些评估方面对读者最为重要,(2)探索有效的评估方法。我们引入第一个大型基准数据集LongStoryEval,包含600部新出版的书籍,平均长度为121K tokens(最大397K)。每本书包括其平均评分和多个读者评论,评论按评估方面组织。通过分析所有用户提及的方面,我们提出了评估标准结构,并开展实验以识别8个顶级准则中最重要的方面。对于评估方法,我们比较了三种类型:聚合式、增量更新式和摘要式评估。我们的发现表明,聚合式和摘要式评估效果更佳,前者在细节评估方面表现突出,后者则提供了更大的效率。基于这些见解,我们进一步提出了NovelCritique,一个利用高效摘要式框架对故事在指定方面进行评论和评分的8B模型。NovelCritique在与人类评估一致性方面超越了像GPT-4o这样的商业模型。我们的数据集和代码均已公开于https://github.com/DingyiYang/LongStoryEval。

关键词

引用

@article{arxiv.2512.12839,
  title  = {What Matters in Evaluating Book-Length Stories? A Systematic Study of Long Story Evaluation},
  author = {Dingyi Yang and Qin Jin},
  journal= {arXiv preprint arXiv:2512.12839},
  year   = {2025}
}

备注

24 pages, 7 figures, Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics