中文

审视摘要数据集的有效性并提升其事实一致性

计算与语言 2022-11-01 v1

摘要

随着抽取式摘要系统的快速发展,摘要评估这一主题近期引起了大量关注。然而,该任务的界定相当模糊,无论是语言学还是自然语言处理社区都未能给出公认的定义。由于缺乏明确界定,大量流行的抽象式摘要数据集的构建方式既无法保证有效性,也不满足摘要最关键的标准之一:事实一致性。本文通过结合最先进的事实一致性模型来识别流行摘要数据集中存在问题的样本,以解决此问题。我们发布了 SummFC,一个具有改进事实一致性的过滤后摘要数据集,并证明在该数据集上训练的模型在几乎所有质量维度上都取得了更好的表现。我们认为该数据集应成为开发和评估摘要系统的有效基准。

关键词

引用

@article{arxiv.2210.17378,
  title  = {Questioning the Validity of Summarization Datasets and Improving Their Factual Consistency},
  author = {Yanzhu Guo and Chloé Clavel and Moussa Kamal Eddine and Michalis Vazirgiannis},
  journal= {arXiv preprint arXiv:2210.17378},
  year   = {2022}
}

备注

Accepted to EMNLP 2022