QAPyramid:文本摘要内容选择的细粒度评估
计算与语言
2025-10-08 v2 人工智能
摘要
如何恰当开展文本摘要的人工评估是一个长期存在的挑战。Pyramid人工评估协议通过将参考摘要分解为子单元并验证其在系统摘要中的存在性来评估内容选择,已被广泛采用。然而,它在子单元的定义与粒度上缺乏系统性。我们通过提出QAPyramid来解决这些问题,该方法根据QA-SRL框架将每个参考摘要分解为更细粒度的问题-答案(QA)对。我们从CNN/DM数据集的参考摘要中收集QA-SRL标注,并评估了10个摘要系统,生成了8.9K个QA级别的标注。我们证明,与Pyramid相比,QAPyramid在保持高标注者间一致性且无需专家标注的同时,提供了更具系统性和细粒度的内容选择评估。此外,我们提出了可自动化评估流程的指标,这些指标与QAPyramid的相关性高于其他广泛采用的指标。
引用
@article{arxiv.2412.07096,
title = {QAPyramid: Fine-grained Evaluation of Content Selection for Text Summarization},
author = {Shiyue Zhang and David Wan and Arie Cattan and Ayal Klein and Ido Dagan and Mohit Bansal},
journal= {arXiv preprint arXiv:2412.07096},
year = {2025}
}
备注
Accepted to COLM 2025. The first two authors contributed equally. Code: https://github.com/ZhangShiyue/QAPyramid