学习何时集中或转移注意力:用于神经机器翻译的自适应注意力温度
计算与语言
2018-08-28 v2 人工智能
摘要
大多数神经机器翻译(NMT)模型基于带有编码器-解码器框架的序列到序列(Seq2Seq)模型,并配备注意力机制。然而,常规注意力机制在每个时间步使用相同的矩阵平等地对待解码,这是有问题的,因为对于不同类型词(如实词与功能词)注意力的软硬度应当不同。因此,我们提出了一种带有称为温度自适应控制(SACT)机制的新模型,通过注意力温度来控制注意力的软硬度。在中英翻译和英越翻译上的实验结果表明,我们的模型优于基线模型,且分析与案例研究表明我们的模型能够关注源端上下文中最相关的元素并生成高质量的翻译。
引用
@article{arxiv.1808.07374,
title = {Learning When to Concentrate or Divert Attention: Self-Adaptive Attention Temperature for Neural Machine Translation},
author = {Junyang Lin and Xu Sun and Xuancheng Ren and Muyu Li and Qi Su},
journal= {arXiv preprint arXiv:1808.07374},
year = {2018}
}
备注
To appear in EMNLP 2018