面向神经机器翻译的多层表示融合
计算与语言
2020-02-18 v1
摘要
神经机器翻译系统需要若干堆叠层以构建深层模型。但预测依赖于最顶层的句子表示,而无法访问低层表示。这使模型训练更困难,并给预测带来信息损失风险。本文中,我们提出一种多层表示融合(MLRF)方法来融合堆叠层。具体地,我们设计三种融合函数以从栈中学习更好的表示。实验结果显示,在IWSLT德英和NIST汉英MT任务上,我们的方法相比强Transformer基线分别带来0.92和0.56 BLEU点的提升。该结果是德英翻译的新state-of-the-art。
关键词
引用
@article{arxiv.2002.06714,
title = {Multi-layer Representation Fusion for Neural Machine Translation},
author = {Qiang Wang and Fuxue Li and Tong Xiao and Yanyang Li and Yinqiao Li and Jingbo Zhu},
journal= {arXiv preprint arXiv:2002.06714},
year = {2020}
}
备注
COLING 2018