中文

面向神经机器翻译的稠密信息流

计算与语言 2018-07-03 v2

摘要

近来,神经机器翻译通过将精心设计的深度神经网络引入其编码器-解码器框架取得了显著进展。从优化角度看,在这些深度架构中,残差连接被用于改善编码器与解码器的学习性能,并且也应用了先进的注意力连接。受DenseNet模型在计算机视觉问题中成功的启发,本文提出一种稠密连接的NMT架构(DenseNMT),能够更高效地为NMT训练。所提DenseNMT不仅允许在编码器与解码器创建新特征时进行稠密连接,还使用稠密注意力结构来改善注意力质量。我们在多个数据集上的实验表明DenseNMT结构更具竞争力且更高效。

关键词

引用

@article{arxiv.1806.00722,
  title  = {Dense Information Flow for Neural Machine Translation},
  author = {Yanyao Shen and Xu Tan and Di He and Tao Qin and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:1806.00722},
  year   = {2018}
}