通过中间微调与数据增强改进零样本与少样本抽象摘要
计算与语言
2021-04-13 v2
摘要
在大型文本语料上以自监督目标预训练的模型在英语文本摘要任务上取得了最先进性能。然而,这些模型通常在数十万数据点上微调,当将摘要应用于新的小众领域时,这是不可行的要求。本工作中,我们引入一种新颖且可泛化的方法 WikiTransfer,以无监督、特定于数据集的方式为摘要微调预训练模型。WikiTransfer 在伪摘要上微调预训练模型,伪摘要由通用维基百科数据生成,包含目标数据集的特征,如所需摘要的长度与抽象程度。WikiTransfer 模型在 CNN-DailyMail 数据集上取得了最先进的零样本抽象摘要性能,并在另外三个多样数据集上展示了我们方法的有效性。这些模型对噪声数据更鲁棒,且在使用 10 与 100 个训练样本时,相较其他摘要数据集的少样本迁移取得了更好或相当的少样本性能。为进一步提升性能,我们采用基于回译的数据增强,并引入正则项以改进少样本迁移。为理解数据集方面在迁移性能与所得输出摘要质量中的作用,我们进一步研究了无监督微调数据各组分的影响,并通过自动与人工评估分析少样本性能。
引用
@article{arxiv.2010.12836,
title = {Improving Zero and Few-Shot Abstractive Summarization with Intermediate Fine-tuning and Data Augmentation},
author = {Alexander R. Fabbri and Simeng Han and Haoyuan Li and Haoran Li and Marjan Ghazvininejad and Shafiq Joty and Dragomir Radev and Yashar Mehdad},
journal= {arXiv preprint arXiv:2010.12836},
year = {2021}
}
备注
NAACL 2021