中文

调查用于评估摘要事实一致性的众包协议

计算与语言 2022-07-12 v3

摘要

当前应用于摘要任务的预训练模型容易出现事实不一致的问题,即错误地表述源文本或引入无关信息。因此,在我们开发改进模型的过程中,比较摘要的事实一致性是必要的。然而,针对事实一致性的最优人工评估设置尚未标准化。为解决此问题,我们基于评分的 Likert 量表和基于排序的 Best-Worst Scaling 协议,在来自 CNN-Daily Mail 和 XSum 数据集各 100 篇文章上、针对四个最先进模型众包了事实一致性评估,以确定最可靠的评估框架。我们发现,基于排序的协议跨数据集提供了更可靠的摘要质量度量,而 Likert 评分的可靠性取决于目标数据集和评估设计。我们的众包模板和摘要评估将公开可用,以促进未来关于摘要事实一致性的研究。

关键词

引用

@article{arxiv.2109.09195,
  title  = {Investigating Crowdsourcing Protocols for Evaluating the Factual Consistency of Summaries},
  author = {Xiangru Tang and Alexander Fabbri and Haoran Li and Ziming Mao and Griffin Thomas Adams and Borui Wang and Asli Celikyilmaz and Yashar Mehdad and Dragomir Radev},
  journal= {arXiv preprint arXiv:2109.09195},
  year   = {2022}
}