单调多头注意力
计算与语言
2019-09-30 v1
摘要
同声机器翻译模型在编码或读取源序列之前就开始生成目标序列。该任务近期的方法要么在顶尖的 Transformer 模型上应用固定策略,要么在较弱的基于循环神经网络的结构上应用可学习的单调注意力。本文中,我们提出一种新的注意力机制,单调多头注意力(MMA),将单调注意力机制扩展到多头注意力。我们还引入了两种新颖且可解释的延迟控制方法,专为多个注意力头设计。我们将 MMA 应用于同声机器翻译任务,并展示出相比此前最优方法 MILk 更好的延迟-质量权衡。我们还分析了延迟控制如何影响注意力跨度,并通过分析解码器层数与头数对质量和延迟的影响,论证了我们模型引入的动机。
引用
@article{arxiv.1909.12406,
title = {Monotonic Multihead Attention},
author = {Xutai Ma and Juan Pino and James Cross and Liezl Puzon and Jiatao Gu},
journal= {arXiv preprint arXiv:1909.12406},
year = {2019}
}