借助 FRANK 基准理解抽象摘要中的事实性:面向事实性度量的评测
计算与语言
2021-07-27 v2
摘要
现代摘要模型生成的文本极为流畅,但常在事实上不可靠。这促使大量旨在衡量自动生成摘要事实性的度量方法涌现。由于缺乏通用基准,这些度量无法进行比较。此外,所有这些方法都将事实性视为二元概念,未能深入揭示不同系统所犯不一致错误的种类。为应对这些局限,我们设计了一套事实错误类型体系,并据此对最先进摘要系统在 CNN/DM 与 XSum 数据集上生成摘要进行了人工标注。通过这些标注,我们辨识了各类摘要模型中不同事实错误类别的比例,并对事实性度量进行基准测试,展示了它们与人类判断的相关性及其各自的优劣。
引用
@article{arxiv.2104.13346,
title = {Understanding Factuality in Abstractive Summarization with FRANK: A Benchmark for Factuality Metrics},
author = {Artidoro Pagnoni and Vidhisha Balachandran and Yulia Tsvetkov},
journal= {arXiv preprint arXiv:2104.13346},
year = {2021}
}
备注
Accepted at NAACL 2021. Second version fixes bug with BERTScore results