通过还原源文本进行生成式文档摘要的预训练
计算与语言
2020-10-13 v4
摘要
生成式文档摘要通常被建模为序列到序列(Seq2Seq)学习问题。遗憾的是,在有限的监督式摘要数据上训练大型基于Seq2Seq的摘要模型颇具挑战。本文提出了三个预训练目标,使我们能够在无标注文本上预训练基于Seq2Seq的生成式摘要模型。其核心思想是,给定一个从文档中人工构建的输入文本,预训练模型以还原原始文档。这些目标包括句子重排序、下一句生成和掩码文档生成,它们与生成式文档摘要任务密切相关。在两个基准摘要数据集(即CNN/DailyMail和纽约时报)上的实验表明,所有三个目标均能相对于基线提升性能。与在大规模数据(超过160GB)上预训练的模型相比,我们的方法仅使用19GB文本进行预训练,便取得了可比的结果,这证明了其有效性。
引用
@article{arxiv.2004.01853,
title = {Pre-training for Abstractive Document Summarization by Reinstating Source Text},
author = {Yanyan Zou and Xingxing Zhang and Wei Lu and Furu Wei and Ming Zhou},
journal= {arXiv preprint arXiv:2004.01853},
year = {2020}
}
备注
EMNLP2020 Camera-Ready, 15 pages