基于 Transformer 的模型在新闻标题生成中的进展
计算与语言
2020-07-28 v2
摘要
基于 Transformer 架构的预训练语言模型是近期 NLP 诸多领域取得突破的原因,包括情感分析、问答、命名实体识别。标题生成是一种特殊的文本摘要任务。模型需要具备超越单个词与句子含义的强自然语言理解能力,以及区分关键信息的能力才能在此任务中取得成功。本文中,我们为该任务微调了两个基于 Transformer 的预训练模型(mBART 和 BertSumAbs),并在俄罗斯新闻的 RIA 和 Lenta 数据集上取得了新的 SOTA 结果。BertSumAbs 相比此前由 Phrase-Based Attentional Transformer 和 CopyNet 取得的最佳分数,ROUGE 分别平均提升 2.9 和 2.0 个点。
引用
@article{arxiv.2007.05044,
title = {Advances of Transformer-Based Models for News Headline Generation},
author = {Alexey Bukhtiyarov and Ilya Gusev},
journal= {arXiv preprint arXiv:2007.05044},
year = {2020}
}
备注
Version 2; Accepted to AINL 2020