中文

通过词汇捷径拓宽神经机器翻译中的表示瓶颈

计算与语言 2019-07-01 v1 机器学习

摘要

Transformer是一种最先进的神经翻译模型,它利用注意力机制,借助来自上下文的信息迭代地精炼词汇表示。词汇特征被输入到第一层,并通过深层隐藏层网络传播。我们认为,在每一层中都表示和传播词汇特征限制了模型学习和表示与该任务相关的其他信息的能力。为缓解这一瓶颈,我们在编码器和解码器内的嵌入层与每个后续层之间引入了门控捷径连接。这使得模型能够动态访问相关词汇内容,而无需在中间状态中耗费有限资源来存储它们。我们表明,在标准WMT翻译任务的5个翻译方向上,所提出的修改相比基线Transformer带来了一致的提升(平均0.9 BLEU),并减少了沿隐藏层传递的词汇信息量。我们还进一步评估了将词汇连接集成到Transformer架构中的不同方式,并给出了探索所提捷径对模型行为影响的消融实验。

关键词

引用

@article{arxiv.1906.12284,
  title  = {Widening the Representation Bottleneck in Neural Machine Translation with Lexical Shortcuts},
  author = {Denis Emelin and Ivan Titov and Rico Sennrich},
  journal= {arXiv preprint arXiv:1906.12284},
  year   = {2019}
}

备注

Accepted submission to WMT 2019