中文

Transformer++

计算与语言 2020-04-02 v1 机器学习 机器学习

摘要

注意力机制的最新进展已取代循环神经网络及其变体用于机器翻译任务。仅使用注意力机制的 Transformer 在序列建模中取得了最先进的(SOTA)结果。基于注意力机制的神经机器翻译可并行化,并且比循环神经网络更有效地解决了句子中词之间长距离依赖的问题。注意力的关键概念之一是学习三个矩阵:查询(query)、键(key)和值(value),通过对词嵌入通过这些矩阵进行线性投影来学习词之间的全局依赖关系。可同时学习多个查询、键、值矩阵,关注嵌入维度的不同子空间,这在 Transformer 中称为多头(multi-head)。我们认为,某些词之间的依赖关系可通过中间上下文更好地学习,而非直接建模词-词依赖。这可能是由于某些依赖的性质或缺乏易于通过多头自注意力全局建模的模式所致。在这项工作中,我们提出了一种通过卷积在多头中使用上下文学习依赖关系的新方法。这种新形式的多头注意力与传统形式结合,在 WMT 2014 英德和英法翻译任务上取得了优于 Transformer 的结果。我们还引入了一个在编码器训练期间学习词性标注(POS tagging)和命名实体识别(NER)信息的框架,进一步提升了结果,在 WMT 2014 英德翻译上实现了 32.1 BLEU 的新 SOTA,比现有最佳高 1.4 BLEU,在 WMT 2014 英法翻译上实现了 44.6 BLEU,比现有最佳高 1.1 BLEU。我们称之为 Transformer++。

关键词

引用

@article{arxiv.2003.04974,
  title  = {Transformer++},
  author = {Prakhar Thapak and Prodip Hore},
  journal= {arXiv preprint arXiv:2003.04974},
  year   = {2020}
}