中文

MiRANews:面向多资源辅助新闻摘要的数据集与基准

计算与语言 2021-09-23 v1

摘要

当前单文档新闻摘要最具挑战性的问题之一是摘要常包含“外在幻觉”,即源文档中不存在、通常借助世界知识推导出的事实。这导致摘要系统更像是开放式语言模型,倾向于生成错误的幻觉事实。本文借助多个补充资源文档辅助该任务以缓解此问题。我们提出一个新的数据集 MiRANews 并对现有摘要模型进行基准测试。与处理多个源文档中多个事件的多文档摘要不同,我们仍旨在为单篇文档生成摘要。通过数据分析我们表明,这不仅是模型的问题:MiRANews 的黄金摘要中超过 27% 的事实在辅助文档上的依据比在主源文章上更好。对基于 MiRANews 微调的预训练模型所生成摘要的误差分析显示,这对模型影响更大:与仅在主文章上训练的单文档摘要模型相比,辅助摘要减少了 55% 的幻觉。我们的代码和数据可在 https://github.com/XinnuoXu/MiRANews 获取。

关键词

引用

@article{arxiv.2109.10650,
  title  = {MiRANews: Dataset and Benchmarks for Multi-Resource-Assisted News Summarization},
  author = {Xinnuo Xu and Ondřej Dušek and Shashi Narayan and Verena Rieser and Ioannis Konstas},
  journal= {arXiv preprint arXiv:2109.10650},
  year   = {2021}
}