中文

基于细粒度自然语言推理的多样化摘要任务忠实度评估

计算与语言 2024-02-28 v1

摘要

我们研究了利用现成自然语言推理 (NLI) 模型评估摘要忠实度的现有方法,并指出由于前提和假设所考虑的粒度级别,这些方法并非最优。具体而言,被视为假设的最小内容单元是句子,而前提由固定数量的文档句子组成。我们提出了一种名为 InFusE 的新方法,该方法使用可变的前提大小,并将摘要句子简化为更短的假设。与以往专注于单一短文档摘要的研究不同,我们分析了基于 NLI 的忠实度评估在多样化摘要任务中的表现。我们引入了 DiverSumm,这是一个新的基准,包含长形式摘要(长文档和长摘要)和多样化摘要任务(例如会议摘要和多文档摘要)。实验表明,InFusE 在不同的摘要任务中均获得了优越的性能。我们的代码和数据可在 https://github.com/HJZnlp/infuse 获取。

关键词

引用

@article{arxiv.2402.17630,
  title  = {Fine-Grained Natural Language Inference Based Faithfulness Evaluation for Diverse Summarisation Tasks},
  author = {Huajian Zhang and Yumo Xu and Laura Perez-Beltrachini},
  journal= {arXiv preprint arXiv:2402.17630},
  year   = {2024}
}

备注

EACL 2024