中文

用于神经机器翻译的胶囊-Transformer

计算与语言 2020-05-01 v1

摘要

Transformer 极大受益于其多头自注意力网络(SAN)的关键设计,该网络通过将给定输入变换至不同子空间而从多视角提取信息。然而,其简单的线性变换聚合策略仍可能潜在地无法充分捕捉更深层的上下文信息。本文因此提出胶囊-Transformer,将线性变换扩展为更一般的胶囊路由算法,并将 SAN 作为胶囊网络的特殊情形。由此得到的胶囊-Transformer 能够通过不同头与词间的信息聚合获得输入序列更好的注意力分布表示。具体而言,我们将 SAN 中的若干组注意力权重视为低层胶囊。通过应用迭代胶囊路由算法,它们可进一步聚合成包含更深上下文信息的高层胶囊。在广泛使用的机器翻译数据集上的实验结果表明,我们提出的胶囊-Transformer 显著优于强 Transformer 基线。

关键词

引用

@article{arxiv.2004.14649,
  title  = {Capsule-Transformer for Neural Machine Translation},
  author = {Sufeng Duan and Juncheng Cao and Hai Zhao},
  journal= {arXiv preprint arXiv:2004.14649},
  year   = {2020}
}