中文

反事实数据增强提升抽取式摘要的事实性

计算与语言 2022-05-26 v1

摘要

基于预训练语言模型的抽取式摘要系统常生成连贯但事实不一致的句子。本文提出一种反事实数据增强方法,通过用扰动的摘要扩充数据以提升训练数据多样性。具体地,我们提出三种基于替换的增强方法:(i) 来自其他及同类别的实体,以及 (ii) 用对应 WordNet 上位词替换名词。我们表明,用我们的方法扩充训练数据可改善摘要的事实正确性,且不会显著影响 ROUGE 分数。我们展示在两个常用摘要数据集(CNN/Dailymail 与 XSum)中,我们将事实正确性平均提升约 2.5 个点。

关键词

引用

@article{arxiv.2205.12416,
  title  = {Counterfactual Data Augmentation improves Factuality of Abstractive Summarization},
  author = {Dheeraj Rajagopal and Siamak Shakeri and Cicero Nogueira dos Santos and Eduard Hovy and Chung-Ching Chang},
  journal= {arXiv preprint arXiv:2205.12416},
  year   = {2022}
}