面向神经机器翻译的稠密信息流
计算与语言
2018-07-03 v2
摘要
近来,神经机器翻译通过将精心设计的深度神经网络引入其编码器-解码器框架取得了显著进展。从优化角度看,在这些深度架构中,残差连接被用于改善编码器与解码器的学习性能,并且也应用了先进的注意力连接。受DenseNet模型在计算机视觉问题中成功的启发,本文提出一种稠密连接的NMT架构(DenseNMT),能够更高效地为NMT训练。所提DenseNMT不仅允许在编码器与解码器创建新特征时进行稠密连接,还使用稠密注意力结构来改善注意力质量。我们在多个数据集上的实验表明DenseNMT结构更具竞争力且更高效。
引用
@article{arxiv.1806.00722,
title = {Dense Information Flow for Neural Machine Translation},
author = {Yanyao Shen and Xu Tan and Di He and Tao Qin and Tie-Yan Liu},
journal= {arXiv preprint arXiv:1806.00722},
year = {2018}
}