面向神经机器翻译的由浅入深的训练方法
计算与语言
2020-10-09 v1
摘要
深层编码器已被证明能有效改进神经机器翻译(NMT)系统,但训练极深的编码器十分耗时。此外,深层模型为何有助于 NMT 仍是一个开放问题。本文中,我们研究了一个调优良好的深层 Transformer 系统的行为。我们发现堆叠层有助于提升 NMT 模型的表示能力,且相邻层表现相似。这启发我们开发一种由浅入深的训练方法,通过堆叠浅层模型来学习深层模型。借此,我们成功训练了一个具有 54 层编码器的 Transformer 系统。在 WMT'16 英德翻译和 WMT'14 英法翻译任务上的实验结果表明,该方法比从头训练快 ,并在两个任务上分别取得 和 的 BLEU 分数。代码已公开于 https://github.com/libeineu/SDT-Training/。
引用
@article{arxiv.2010.03737,
title = {Shallow-to-Deep Training for Neural Machine Translation},
author = {Bei Li and Ziyang Wang and Hui Liu and Yufan Jiang and Quan Du and Tong Xiao and Huizhen Wang and Jingbo Zhu},
journal= {arXiv preprint arXiv:2010.03737},
year = {2020}
}
备注
Accepted by EMNLP 2020