LongSumEval:基于问题-答案的长文档摘要评估与反馈驱动的细化
计算与语言
2026-04-29 v1
摘要
长文档摘要的评估仍是摘要研究的主要瓶颈。现有的评估指标与人类判断之间的关联较弱,产生的聚合分数没有解释不足之处或指导改进,阻碍了需要可验证准确性的应用中的有效细化。我们引入 LongSumEval,一个统一的框架通过结构化问题-答案反馈桥接评估与生成。该框架将摘要质量操作化为问题-答案对的可解答性和事实一致性,生成可解释的分数和可操作的反馈,识别覆盖不足和事实不一致。这是解决评估独立于生成目标的误差。我们对 QA 基于的评估模块进行了元评估,跨七个基准测试显示,与 established 指标相比,显著增强了与人类判断的一致性。结构化反馈通过 self-refinement 实现显著质量提升,无需重新训练。通过演示评估反馈可作为可执行指令用于生成,本工作确立了一种通用的对齐评估与改进的范式,对需要可验证准确性和透明质量控制的可控文本生成具有直接影响。所有代码和数据集将在 GitHub 上发布以便复现。
引用
@article{arxiv.2604.25130,
title = {LongSumEval: Question-Answering Based Evaluation and Feedback-Driven Refinement for Long Document Summarization},
author = {Huyen Nguyen and Haoxuan Zhang and Yang Zhang and Haihua Chen and Junhua Ding},
journal= {arXiv preprint arXiv:2604.25130},
year = {2026}
}
备注
13 pages, 3 figures