中文

EVA-Score:基于抽取与验证评估抽象长文档摘要的可信度

计算与语言 2026-01-30 v4

摘要

自从 LLM 出现后,人们对抽象长文档摘要越来越关注,因为更长的输入序列蕴含更多信息。然而,这类摘要的自动评估仍未得到充分探讨。当前的长文档摘要评估指标要么使用基于相似性的指标如 ROUGE 和 BERTScore,要么使用合适提示词或预定义模式的 LLM 指标。我们认为前者仅依赖相似性,未考虑信息性,而后者缺乏对信息丰富性的量化分析,主观性强且难以解释。现有的评估指标要么使用传统指标如 ROUGE 和 BERTScore,这些指标依赖表层相似性,未能考虑信息性;要么使用简单的 LLM 指标,这些指标不够稳健,容易被长上下文所淹没。本文提出一种新的评估指标 EVA-Score,从给定摘要中提取所有信息,基于参考文献识别重叠信息,并计算信息得分。我们在多个数据集上测试了 EVA-Score,实验结果表明 EVA-Score 与人类评分的相关性最高。我们还从信息角度重新评估了 LLMs 在长文档摘要任务中的表现,结果表明 LLM 的输出仍与人类编写的答案存在差距。此外,我们对 EVA-Score 的有效性进行了详细分析,为自动评估抽象长文档摘要的未来方向提供了展望。

关键词

引用

@article{arxiv.2407.04969,
  title  = {EVA-Score: Evaluating Abstractive Long-form Summarization on Informativeness through Extraction and Validation},
  author = {Yuchen Fan and Yazhe Wan and Xin Zhong and Haonan Cheng and Ning Ding and Bowen Zhou},
  journal= {arXiv preprint arXiv:2407.04969},
  year   = {2026}
}

备注

20 pages