面向神经机器翻译的多粒度自注意力
计算与语言
2019-09-06 v1
摘要
当前最先进的神经机器翻译(NMT)使用深层多头自注意力网络,不含显式的短语信息。然而,统计机器翻译的先前工作表明,将基本翻译单元从词扩展到短语带来了实质性改进,这暗示了通过显式建模短语来提升 NMT 性能的可能性。在本工作中,我们提出多粒度自注意力(Mg-Sa):一种结合多头自注意力与短语建模的神经网络。具体而言,我们训练若干注意力头以 n-gram 或句法形式关注短语。此外,我们利用短语间的交互来增强结构建模的能力——这是自注意力常被提及的弱点。在 WMT14 英德翻译和 NIST 汉英翻译任务上的实验结果表明,所提方法持续提升了性能。针对性的语言学分析揭示,Mg-Sa 确实在各种粒度上捕获了有用的短语信息。
引用
@article{arxiv.1909.02222,
title = {Multi-Granularity Self-Attention for Neural Machine Translation},
author = {Jie Hao and Xing Wang and Shuming Shi and Jinfeng Zhang and Zhaopeng Tu},
journal= {arXiv preprint arXiv:1909.02222},
year = {2019}
}
备注
EMNLP 2019