中文

借助 FRANK 基准理解抽象摘要中的事实性:面向事实性度量的评测

计算与语言 2021-07-27 v2

摘要

现代摘要模型生成的文本极为流畅,但常在事实上不可靠。这促使大量旨在衡量自动生成摘要事实性的度量方法涌现。由于缺乏通用基准,这些度量无法进行比较。此外,所有这些方法都将事实性视为二元概念,未能深入揭示不同系统所犯不一致错误的种类。为应对这些局限,我们设计了一套事实错误类型体系,并据此对最先进摘要系统在 CNN/DM 与 XSum 数据集上生成摘要进行了人工标注。通过这些标注,我们辨识了各类摘要模型中不同事实错误类别的比例,并对事实性度量进行基准测试,展示了它们与人类判断的相关性及其各自的优劣。

关键词

引用

@article{arxiv.2104.13346,
  title  = {Understanding Factuality in Abstractive Summarization with FRANK: A Benchmark for Factuality Metrics},
  author = {Artidoro Pagnoni and Vidhisha Balachandran and Yulia Tsvetkov},
  journal= {arXiv preprint arXiv:2104.13346},
  year   = {2021}
}

备注

Accepted at NAACL 2021. Second version fixes bug with BERTScore results