中文

用于神经机器翻译的硬编码高斯注意力

计算与语言 2020-05-05 v1

摘要

近期工作对 Transformer 的多头注意力对于实现高翻译质量的重要性提出了质疑。我们沿此方向进一步推进,开发了一种没有任何可学习参数的“硬编码”注意力变体。令人惊讶的是,在四种不同语言对上,将编码器和解码器中所有可学习的自注意力头替换为固定的、与输入无关的高斯分布,对 BLEU 分数的影响极小。然而,额外将交叉注意力(连接解码器与编码器)也硬编码会显著降低 BLEU,表明其比自注意力更为重要。通过在其他方面硬编码的 Transformer 中仅添加一个可学习的交叉注意力头,即可恢复大部分 BLEU 损失。总体而言,我们的结果深入揭示了 Transformer 中哪些组件真正重要,我们希望这将指导未来开发更简单、更高效的基于注意力的模型的工作。

关键词

引用

@article{arxiv.2005.00742,
  title  = {Hard-Coded Gaussian Attention for Neural Machine Translation},
  author = {Weiqiu You and Simeng Sun and Mohit Iyyer},
  journal= {arXiv preprint arXiv:2005.00742},
  year   = {2020}
}

备注

ACL 2020 Camera Ready (12 pages)