中文

两全其美:结合神经机器翻译的最新进展

计算与语言 2018-04-30 v2 人工智能

摘要

过去一年见证了序列到序列(seq2seq)建模在机器翻译(MT)中的快速发展。经典的基于 RNN 的 MT 方法首先被卷积 seq2seq 模型超越,随后又被更近的 Transformer 模型超越。这些新方法中每一种都由一个基础架构以及一组建模与训练技术组成,这些技术在原则上可应用于其他 seq2seq 架构。在本文中,我们以两种方式梳理这些新架构及其伴随技术。首先,我们识别出若干关键的建模与训练技术,并将其应用于 RNN 架构,从而产生了一个新的 RNMT+ 模型,该模型在基准 WMT'14 英译法与英译德任务上优于全部三种基础架构。其次,我们分析每种基础 seq2seq 架构的特性,并设计旨在结合其优势的新混合架构。我们的混合模型取得了进一步的改进,在这两个基准数据集上均优于 RNMT+ 模型。

关键词

引用

@article{arxiv.1804.09849,
  title  = {The Best of Both Worlds: Combining Recent Advances in Neural Machine Translation},
  author = {Mia Xu Chen and Orhan Firat and Ankur Bapna and Melvin Johnson and Wolfgang Macherey and George Foster and Llion Jones and Niki Parmar and Mike Schuster and Zhifeng Chen and Yonghui Wu and Macduff Hughes},
  journal= {arXiv preprint arXiv:1804.09849},
  year   = {2018}
}