中文

DTMT:一种用于神经机器翻译的新型深度转移架构

计算与语言 2019-07-17 v2

摘要

过去几年,神经机器翻译(NMT)取得了快速发展。最近,借助先进的建模与训练技术,基于 RNN 的 NMT(RNMT)已展现出其潜在优势,即便与著名的 Transformer(自注意力)模型相比也是如此。尽管 RNMT 模型可通过堆叠层构建非常深的架构,但沿序列轴上连续隐藏状态之间的转移深度仍然较浅。在本文中,我们进一步通过增加连续隐藏状态之间的转移深度来增强基于 RNN 的 NMT,并构建了一种用于神经机器翻译的新型基于 RNN 的深度转移架构,称为 DTMT。该模型通过多个非线性变换增强隐藏到隐藏的转移,并通过精心设计的线性变换机制在整个深度转移过程中保持线性变换路径,以缓解梯度消失问题。实验表明,借助专门设计的深度转移模块,我们的 DTMT 能在翻译质量上取得显著提升。在汉英翻译任务上的实验结果显示,DTMT 可比 Transformer 模型高出 +2.09 个 BLEU 点,并达到同一数据集上已报道的最佳结果。在 WMT14 英德和英法翻译任务上,DTMT 展现出优于包括 Transformer 和 RNMT+ 在内的当前最优 NMT 系统的翻译质量。

关键词

引用

@article{arxiv.1812.07807,
  title  = {DTMT: A Novel Deep Transition Architecture for Neural Machine Translation},
  author = {Fandong Meng and Jinchao Zhang},
  journal= {arXiv preprint arXiv:1812.07807},
  year   = {2019}
}

备注

Accepted at AAAI 2019. Code is available at: https://github.com/fandongmeng/DTMT_InDec