LongDocFACTScore:评估长文档抽取式摘要的事实一致性
计算与语言
2024-05-29 v2 人工智能
机器学习
摘要
保持事实一致性是抽取式文本摘要中的一个关键问题,然而它无法通过用于评估文本摘要的传统自动指标(如 ROUGE 评分)来评估。近期已有一些工作致力于利用预训练语言模型开发改进的事实一致性度量指标,但这些指标具有受限的 token 限制,因此不适合评估长文档文本摘要。此外,关于评估现有自动评估指标在长文档场景下是否适用的研究与资源十分有限。在本工作中,我们评估了自动指标在评估长文档文本摘要事实一致性方面的效能。我们创建了一个用于评估自动事实性指标的人工标注数据集 LongSciVerify,其中包含来自科学领域的长文档摘要的细粒度事实一致性标注。我们还提出了一种适用于评估长文档摘要的新评估框架 LongDocFACTScore。该框架允许将指标高效扩展到任意长度文档,并且在用于评估长文档摘要数据集时,其与人类事实性度量的相关性优于现有的最先进指标。我们将我们的代码和 LongSciVerify 数据集公开提供:https://github.com/jbshp/LongDocFACTScore。
引用
@article{arxiv.2309.12455,
title = {LongDocFACTScore: Evaluating the Factuality of Long Document Abstractive Summarisation},
author = {Jennifer A Bishop and Qianqian Xie and Sophia Ananiadou},
journal= {arXiv preprint arXiv:2309.12455},
year = {2024}
}
备注
This paper has been published in LREC-COLING 2024, Pages 10777-10789 and was presented as an oral presentation during the conference held in Turin, Italy. The published version is available at https://aclanthology.org/2024.lrec-main.941. 13 pages, 5 figures