利用导语偏置进行零样本抽象式新闻摘要
计算与语言
2021-04-19 v4
摘要
新闻文章中的一种典型新闻惯例是在开头传递最显著的信息,也称为导语偏置(lead bias)。虽然这一现象可用于生成摘要,但它对教导模型一般性地判别和提取重要信息有不利影响。我们提出可以以一种简单有效的方式将这一导语偏置为我们所用,在大规模无标注新闻语料上预训练抽象式新闻摘要模型:利用文章其余部分预测导语句。我们收集了大规模新闻语料,并通过统计分析进行数据清洗和过滤。然后我们对该数据集上的现有生成模型 BART 和 T5 应用自监督预训练以进行领域适配。通过在六个基准数据集上的大量实验,我们表明该方法能显著提升摘要质量,并在零样本新闻摘要中无需任何微调即达到最先进(state-of-the-art, SOTA)结果。例如,在 DUC2003 数据集上,BART 的 ROUGE-1 分数在导语偏置预训练后提升了 13.7%。我们将该模型部署于 Microsoft News,并提供公共 API 以及一个多语言新闻摘要演示网站。
引用
@article{arxiv.1912.11602,
title = {Leveraging Lead Bias for Zero-shot Abstractive News Summarization},
author = {Chenguang Zhu and Ziyi Yang and Robert Gmyr and Michael Zeng and Xuedong Huang},
journal= {arXiv preprint arXiv:1912.11602},
year = {2021}
}
备注
Published in ACM SIGIR 2021