基于细粒度自然语言推理的多样化摘要任务忠实度评估
计算与语言
2024-02-28 v1
摘要
我们研究了利用现成自然语言推理 (NLI) 模型评估摘要忠实度的现有方法,并指出由于前提和假设所考虑的粒度级别,这些方法并非最优。具体而言,被视为假设的最小内容单元是句子,而前提由固定数量的文档句子组成。我们提出了一种名为 InFusE 的新方法,该方法使用可变的前提大小,并将摘要句子简化为更短的假设。与以往专注于单一短文档摘要的研究不同,我们分析了基于 NLI 的忠实度评估在多样化摘要任务中的表现。我们引入了 DiverSumm,这是一个新的基准,包含长形式摘要(长文档和长摘要)和多样化摘要任务(例如会议摘要和多文档摘要)。实验表明,InFusE 在不同的摘要任务中均获得了优越的性能。我们的代码和数据可在 https://github.com/HJZnlp/infuse 获取。
引用
@article{arxiv.2402.17630,
title = {Fine-Grained Natural Language Inference Based Faithfulness Evaluation for Diverse Summarisation Tasks},
author = {Huajian Zhang and Yumo Xu and Laura Perez-Beltrachini},
journal= {arXiv preprint arXiv:2402.17630},
year = {2024}
}
备注
EACL 2024