中文

基于 Transformer 的模型在新闻标题生成中的进展

计算与语言 2020-07-28 v2

摘要

基于 Transformer 架构的预训练语言模型是近期 NLP 诸多领域取得突破的原因,包括情感分析、问答、命名实体识别。标题生成是一种特殊的文本摘要任务。模型需要具备超越单个词与句子含义的强自然语言理解能力,以及区分关键信息的能力才能在此任务中取得成功。本文中,我们为该任务微调了两个基于 Transformer 的预训练模型(mBART 和 BertSumAbs),并在俄罗斯新闻的 RIA 和 Lenta 数据集上取得了新的 SOTA 结果。BertSumAbs 相比此前由 Phrase-Based Attentional Transformer 和 CopyNet 取得的最佳分数,ROUGE 分别平均提升 2.9 和 2.0 个点。

关键词

引用

@article{arxiv.2007.05044,
  title  = {Advances of Transformer-Based Models for News Headline Generation},
  author = {Alexey Bukhtiyarov and Ilya Gusev},
  journal= {arXiv preprint arXiv:2007.05044},
  year   = {2020}
}

备注

Version 2; Accepted to AINL 2020