HIBERT:用于文档摘要的分层双向 Transformer 文档级预训练
计算与语言
2019-05-17 v1 机器学习
摘要
神经抽取式摘要模型通常采用分层编码器进行文档编码,并使用句子级标签进行训练,这些标签是通过基于规则的方法启发式创建的。使用这些\emph{不准确}的标签来训练分层编码器具有挑战性。受近期关于预训练 Transformer 句子编码器工作的启发\cite{devlin:2018:arxiv},我们提出{\sc Hibert}(作为{\bf HI}erarchical {\bf B}idirectional {\bf E}ncoder {\bf R}epresentations from {\bf T}ransformers 的简称)用于文档编码,并提出了一种利用无标签数据对其进行预训练的方法。我们将预训练后的{\sc Hibert}应用于我们的摘要模型,其在 CNN/Dailymail 数据集上比随机初始化的对应模型高出 1.25 ROUGE,在 New York Times 数据集的一个版本上高出 2.0 ROUGE。我们还在这两个数据集上取得了最先进的性能。
引用
@article{arxiv.1905.06566,
title = {HIBERT: Document Level Pre-training of Hierarchical Bidirectional Transformers for Document Summarization},
author = {Xingxing Zhang and Furu Wei and Ming Zhou},
journal= {arXiv preprint arXiv:1905.06566},
year = {2019}
}
备注
to appear in ACL 2019