中文

理解摘要中的事实性错误:错误类型、摘要系统、数据集与错误检测器

计算与语言 2023-05-29 v2 人工智能

摘要

抽象式摘要模型容易产生事实性错误的倾向已被广泛研究,包括设计检测事实性错误的度量标准以及对当前系统输出中的错误进行标注。然而,摘要系统、度量标准和标注基准的不断演化使得事实性评估成为一个移动目标,在各项度量标准之间进行清晰比较已变得越来越困难。在这项工作中,我们聚合了九个现有数据集中的事实性错误标注,并根据底层摘要模型对其进行分层。我们在这个分层基准上比较了最先进的事实性度量标准(包括近期基于ChatGPT的度量标准)的性能,结果表明它们的性能在不同类型的摘要模型之间存在显著差异。关键的是,我们的分析显示,事实性检测领域近期的许多进展都集中在较旧(Transformer之前)模型的摘要上,而非更相关的近期摘要模型。我们进一步按错误类型进行了更细粒度的分析,发现不同事实性度量标准在不同错误类型上也存在类似的性能差异。我们的结果表明,没有任何一种度量标准在所有设置或所有错误类型上都占优,并基于这些见解提供了最佳实践建议。

关键词

引用

@article{arxiv.2205.12854,
  title  = {Understanding Factual Errors in Summarization: Errors, Summarizers, Datasets, Error Detectors},
  author = {Liyan Tang and Tanya Goyal and Alexander R. Fabbri and Philippe Laban and Jiacheng Xu and Semih Yavuz and Wojciech Kryściński and Justin F. Rousseau and Greg Durrett},
  journal= {arXiv preprint arXiv:2205.12854},
  year   = {2023}
}

备注

Accepted to ACL 2023