中文

用于神经机器翻译的深度架构

计算与语言 2017-07-25 v1

摘要

已有研究表明,增加模型深度可提升神经机器翻译的质量。然而,人们已提出了多种增加模型深度的架构变体,且迄今为止尚无彻底的比较研究。在本工作中,我们描述并评估了在神经机器翻译中引入深度的几种现有方法。此外,我们探索了新颖的架构变体,包括深度过渡 RNN,并改变了注意力在深度解码器中的使用方式。我们引入了一种新颖的“BiDeep” RNN 架构,它结合了深度过渡 RNN 和堆叠 RNN。我们的评估在英语到德语的 WMT 新闻翻译数据集上进行,并在单 GPU 机器上进行训练和推理。我们发现,我们提出的几种架构在速度和翻译质量上均优于现有方法。我们在组合深度为 8 的 BiDeep RNN 上获得了最佳改进,相较于一个强大的浅层基线平均提升了 1.5 BLEU。我们发布了代码以便于采用。

关键词

引用

@article{arxiv.1707.07631,
  title  = {Deep Architectures for Neural Machine Translation},
  author = {Antonio Valerio Miceli Barone and Jindřich Helcl and Rico Sennrich and Barry Haddow and Alexandra Birch},
  journal= {arXiv preprint arXiv:1707.07631},
  year   = {2017}
}

备注

WMT 2017 research track