神经机器翻译中的并行注意力机制
计算与语言
2018-10-31 v1 人工智能
摘要
神经机器翻译的近期论文提出严格使用注意力机制,以取代循环和卷积神经网络(RNNs 和 CNNs)等先前标准。我们提出,通过并行运行以编码器-解码器注意力为中心的架构中传统上堆叠的编码分支,可以从模型中移除更多顺序操作,从而减少训练时间。具体而言,我们修改了谷歌最近发布的称为 Transformer 的基于注意力的架构,用并行注意力模块替换顺序注意力模块,在减少训练时间的同时大幅提升了 BLEU 分数。在英语到德语和英语到法语翻译任务上的实验表明,我们的模型确立了新的 SOTA。
引用
@article{arxiv.1810.12427,
title = {Parallel Attention Mechanisms in Neural Machine Translation},
author = {Julian Richard Medina and Jugal Kalita},
journal= {arXiv preprint arXiv:1810.12427},
year = {2018}
}
备注
ICMLA 2018, 6 pages