用于抽象摘要的多阶段预训练
计算与语言
2019-09-25 v1
摘要
抽象摘要的神经模型往往在具备高度专门化、摘要特定的建模附加组件(如指针-生成器、覆盖建模和推断时启发式)时取得最佳性能。我们在此表明,预训练可以补充此类建模进展,通过两个关键概念——全网络初始化与多阶段预训练——在短文本与长文本抽象摘要中均产生改进结果。我们的方法使模型能够传递性地受益于多个预训练任务,从通用语言任务到专门的摘要任务,再到如基于要点的摘要等更专门的任务。使用该方法,我们在Gigaword基准上展示了ROUGE-L提升1.05点,在CNN/DailyMail基准上提升1.78点,相较于随机初始化基线。
引用
@article{arxiv.1909.10599,
title = {Multi-stage Pretraining for Abstractive Summarization},
author = {Sebastian Goodman and Zhenzhong Lan and Radu Soricut},
journal= {arXiv preprint arXiv:1909.10599},
year = {2019}
}