中文

HIBERT:用于文档摘要的分层双向 Transformer 文档级预训练

计算与语言 2019-05-17 v1 机器学习

摘要

神经抽取式摘要模型通常采用分层编码器进行文档编码,并使用句子级标签进行训练,这些标签是通过基于规则的方法启发式创建的。使用这些\emph{不准确}的标签来训练分层编码器具有挑战性。受近期关于预训练 Transformer 句子编码器工作的启发\cite{devlin:2018:arxiv},我们提出{\sc Hibert}(作为{\bf HI}erarchical {\bf B}idirectional {\bf E}ncoder {\bf R}epresentations from {\bf T}ransformers 的简称)用于文档编码,并提出了一种利用无标签数据对其进行预训练的方法。我们将预训练后的{\sc Hibert}应用于我们的摘要模型,其在 CNN/Dailymail 数据集上比随机初始化的对应模型高出 1.25 ROUGE,在 New York Times 数据集的一个版本上高出 2.0 ROUGE。我们还在这两个数据集上取得了最先进的性能。

关键词

引用

@article{arxiv.1905.06566,
  title  = {HIBERT: Document Level Pre-training of Hierarchical Bidirectional Transformers for Document Summarization},
  author = {Xingxing Zhang and Furu Wei and Ming Zhou},
  journal= {arXiv preprint arXiv:1905.06566},
  year   = {2019}
}

备注

to appear in ACL 2019