中文

基于弱循环单元的深层神经机器翻译

计算与语言 2018-05-14 v1

摘要

递归神经网络(RNNs)多年来一直是神经机器翻译领域的最优方法。近来,一些新架构被提出,它们比经典 RNNs 能更好地利用 GPU 上的并行计算。更快的训练与推理,结合不同的序列到序列建模,也带来了性能提升。尽管新模型已完全脱离最初的循环架构,我们仍决定探究如何使 RNNs 更高效。本文提出一种名为 Simple Recurrent NMT 的新型循环神经机器翻译架构,其构建于一类使用层归一化与多重注意力机制的快速弱循环单元之上。我们在 WMT14 英德翻译与 WMT16 英罗翻译基准上的实验表明,该模型是 LSTMs 的有效替代方案,因为它能以显著更低的计算成本取得更优结果。

关键词

引用

@article{arxiv.1805.04185,
  title  = {Deep Neural Machine Translation with Weakly-Recurrent Units},
  author = {Mattia Antonino Di Gangi and Marcello Federico},
  journal= {arXiv preprint arXiv:1805.04185},
  year   = {2018}
}

备注

10 pages, 3 figures, accepted as a conference paper at the 21st Annual Conference of the European Association for Machine Translation (EAMT) 2018