中文

神经机器翻译中的并行注意力机制

计算与语言 2018-10-31 v1 人工智能

摘要

神经机器翻译的近期论文提出严格使用注意力机制,以取代循环和卷积神经网络(RNNs 和 CNNs)等先前标准。我们提出,通过并行运行以编码器-解码器注意力为中心的架构中传统上堆叠的编码分支,可以从模型中移除更多顺序操作,从而减少训练时间。具体而言,我们修改了谷歌最近发布的称为 Transformer 的基于注意力的架构,用并行注意力模块替换顺序注意力模块,在减少训练时间的同时大幅提升了 BLEU 分数。在英语到德语和英语到法语翻译任务上的实验表明,我们的模型确立了新的 SOTA。

关键词

引用

@article{arxiv.1810.12427,
  title  = {Parallel Attention Mechanisms in Neural Machine Translation},
  author = {Julian Richard Medina and Jugal Kalita},
  journal= {arXiv preprint arXiv:1810.12427},
  year   = {2018}
}

备注

ICMLA 2018, 6 pages