FENICE:基于自然语言推理与声明抽取的摘要事实性评估
计算与语言
2024-09-04 v3
摘要
近年来,文本摘要领域取得了显著进展,尤其是随着大型语言模型(LLMs)的出现,其表现令人瞩目。然而,一个显著的挑战依然存在:大量自动生成的摘要表现出事实不一致性,例如幻觉。针对这一问题,出现了各种评估摘要一致性的方法。但是,这些新提出的指标面临若干局限性,包括缺乏可解释性、侧重于短文档摘要(例如新闻文章),以及计算上的不切实际,尤其是对于基于 LLM 的指标而言。为了解决这些缺陷,我们提出了基于自然语言推理与声明抽取的摘要事实性评估(FENICE),一种更具可解释性和高效性的面向事实性的指标。FENICE 利用源文档中的信息与从摘要中提取的一组原子事实(称为声明)之间的基于 NLI 的对齐。我们的指标在事实性评估的事实标准基准 AGGREFACT 上达到了新的 SOTA。此外,通过对长文本摘要进行人工标注过程,我们将评估扩展到了更具挑战性的场景。为了促进摘要事实性评估的研究,我们在 https://github.com/Babelscape/FENICE 发布了我们的指标代码以及长文本摘要的事实性标注。
引用
@article{arxiv.2403.02270,
title = {FENICE: Factuality Evaluation of summarization based on Natural language Inference and Claim Extraction},
author = {Alessandro Scirè and Karim Ghonim and Roberto Navigli},
journal= {arXiv preprint arXiv:2403.02270},
year = {2024}
}
备注
ACL 2024 camera ready. Code and data at https://github.com/Babelscape/FENICE