中文

学习深度 Transformer 模型用于机器翻译

计算与语言 2019-06-06 v1 机器学习

摘要

Transformer 是近期机器翻译评测中的最先进模型。两条研究路线有望改进此类模型:其一是使用宽网络(即 Transformer-Big),已成为 Transformer 系统开发的事实标准;其二是使用更深的语言表示,但面临深度网络学习的困难。本文延续后一条研究路线。我们主张,真正的深度 Transformer 模型可通过 1) 恰当使用层归一化以及 2) 一种将前几层组合传递给下一层的全新方式,超越 Transformer-Big 对应模型。在 WMT'16 英德、NIST OpenMT'12 中英以及更大规模的 WMT'18 中英任务上,我们的深度系统(30/25 层编码器)比浅层 Transformer-Big/Base 基线(6 层编码器)高出 0.4-2.4 个 BLEU 点。作为额外好处,深度模型在规模上比 Transformer-Big 小 1.6 倍,训练速度快 3 倍。

关键词

引用

@article{arxiv.1906.01787,
  title  = {Learning Deep Transformer Models for Machine Translation},
  author = {Qiang Wang and Bei Li and Tong Xiao and Jingbo Zhu and Changliang Li and Derek F. Wong and Lidia S. Chao},
  journal= {arXiv preprint arXiv:1906.01787},
  year   = {2019}
}

备注

Accepted by ACL 2019