QAFactEval:用于摘要的改进的基于 QA 的事实一致性评估
计算与语言
2022-05-02 v2
摘要
在实际场景中,事实一致性是文本摘要模型的一项关键质量。现有对该维度的评估工作可大致分为两类研究路线:基于蕴涵的度量与基于问答(QA)的度量,而不同的实验设置常导致关于何种范式表现最佳的相反结论。本工作中,我们对基于蕴涵与基于 QA 的度量进行了广泛比较,证明仔细选择基于 QA 的度量的组成部分(尤其是问题生成与可答性分类)对性能至关重要。基于这些见解,我们提出了一种优化度量,称之为 QAFactEval,其在 SummaC 事实一致性基准上比先前的基于 QA 的度量平均提升 14%,并且也优于表现最佳的基于蕴涵的度量。此外,我们发现基于 QA 与基于蕴涵的度量可提供互补信号,并可组合为单一度量以进一步提升性能。
引用
@article{arxiv.2112.08542,
title = {QAFactEval: Improved QA-Based Factual Consistency Evaluation for Summarization},
author = {Alexander R. Fabbri and Chien-Sheng Wu and Wenhao Liu and Caiming Xiong},
journal= {arXiv preprint arXiv:2112.08542},
year = {2022}
}
备注
NAACL 2022