中文

面向神经机器翻译的由浅入深的训练方法

计算与语言 2020-10-09 v1

摘要

深层编码器已被证明能有效改进神经机器翻译(NMT)系统,但训练极深的编码器十分耗时。此外,深层模型为何有助于 NMT 仍是一个开放问题。本文中,我们研究了一个调优良好的深层 Transformer 系统的行为。我们发现堆叠层有助于提升 NMT 模型的表示能力,且相邻层表现相似。这启发我们开发一种由浅入深的训练方法,通过堆叠浅层模型来学习深层模型。借此,我们成功训练了一个具有 54 层编码器的 Transformer 系统。在 WMT'16 英德翻译和 WMT'14 英法翻译任务上的实验结果表明,该方法比从头训练快 1.41.4 ×\times,并在两个任务上分别取得 30.3330.3343.2943.29 的 BLEU 分数。代码已公开于 https://github.com/libeineu/SDT-Training/。

关键词

引用

@article{arxiv.2010.03737,
  title  = {Shallow-to-Deep Training for Neural Machine Translation},
  author = {Bei Li and Ziyang Wang and Hui Liu and Yufan Jiang and Quan Du and Tong Xiao and Huizhen Wang and Jingbo Zhu},
  journal= {arXiv preprint arXiv:2010.03737},
  year   = {2020}
}

备注

Accepted by EMNLP 2020