用于神经机器翻译的带快进连接的深度循环模型
计算与语言
2016-07-26 v3 机器学习
摘要
神经机器翻译 (NMT) 旨在利用神经网络解决机器翻译 (MT) 问题,并在近年来展现出可喜的成果。然而,现有的 NMT 模型大多是浅层的,单一 NMT 模型与最佳传统 MT 系统之间仍存在性能差距。在这项工作中,我们基于深度 Long Short-Term Memory (LSTM) 网络引入了一种新型线性连接(称为快进连接),以及一种用于堆叠 LSTM 层的交错双向架构。快进连接在传播梯度和构建深度为 16 的深度拓扑结构中发挥了关键作用。在 WMT'14 英法翻译任务中,我们使用单一注意力模型实现了 BLEU=37.7,比相应的单一浅层模型高出 6.2 个 BLEU 点。这是单一 NMT 模型首次实现 SOTA 性能,并比最佳传统模型高出 0.7 个 BLEU 点。即使不使用注意力机制,我们仍能实现 BLEU=36.3。在对未知词进行特殊处理并进行模型集成后,我们获得了该任务迄今报告的最佳得分 BLEU=40.4。我们的模型还在更困难的 WMT'14 英德翻译任务上得到了验证。
引用
@article{arxiv.1606.04199,
title = {Deep Recurrent Models with Fast-Forward Connections for Neural Machine Translation},
author = {Jie Zhou and Ying Cao and Xuguang Wang and Peng Li and Wei Xu},
journal= {arXiv preprint arXiv:1606.04199},
year = {2016}
}
备注
TACL 2016