调查用于评估摘要事实一致性的众包协议
计算与语言
2022-07-12 v3
摘要
当前应用于摘要任务的预训练模型容易出现事实不一致的问题,即错误地表述源文本或引入无关信息。因此,在我们开发改进模型的过程中,比较摘要的事实一致性是必要的。然而,针对事实一致性的最优人工评估设置尚未标准化。为解决此问题,我们基于评分的 Likert 量表和基于排序的 Best-Worst Scaling 协议,在来自 CNN-Daily Mail 和 XSum 数据集各 100 篇文章上、针对四个最先进模型众包了事实一致性评估,以确定最可靠的评估框架。我们发现,基于排序的协议跨数据集提供了更可靠的摘要质量度量,而 Likert 评分的可靠性取决于目标数据集和评估设计。我们的众包模板和摘要评估将公开可用,以促进未来关于摘要事实一致性的研究。
引用
@article{arxiv.2109.09195,
title = {Investigating Crowdsourcing Protocols for Evaluating the Factual Consistency of Summaries},
author = {Xiangru Tang and Alexander Fabbri and Haoran Li and Ziming Mao and Griffin Thomas Adams and Borui Wang and Asli Celikyilmaz and Yashar Mehdad and Dragomir Radev},
journal= {arXiv preprint arXiv:2109.09195},
year = {2022}
}