用于机器翻译的混合自注意力网络
计算与语言
2018-12-11 v3
摘要
编码器-解码器是神经机器翻译(NMT)的典型框架,人们已开发不同结构以提升翻译性能。Transformer是最有前景的结构之一,它可利用自注意力机制从全局视角捕捉语义依赖。然而,它不能很好地区分不同词元的相对位置(如位于当前词元左侧或右侧的词元),也无法聚焦于当前词元周围的局部信息。为缓解这些问题,我们提出一种名为混合自注意力网络(HySAN)的新型注意力机制,其为自注意力网络配备专门设计的掩码以提取各类语义,如全局/局部信息、左/右部分上下文。最后,引入一个压缩门来组合不同类型的SAN以实现融合。在三个机器翻译任务上的实验结果表明,我们提出的框架显著优于Transformer基线,并取得了优于最先进NMT系统的结果。
引用
@article{arxiv.1811.00253,
title = {Hybrid Self-Attention Network for Machine Translation},
author = {Kaitao Song and Xu Tan and Furong Peng and Jianfeng Lu},
journal= {arXiv preprint arXiv:1811.00253},
year = {2018}
}