用于神经机器翻译的多单元 Transformer
计算与语言
2020-10-26 v2
摘要
Transformer 模型在神经机器翻译中取得显著成功。许多工作致力于通过级联堆叠若干单元(即多头注意力与 FFN 的组合)来加深 Transformer,而对多个并行单元的研究鲜有关注。本文中,我们提出多单元 Transformer (MUTE),旨在通过引入多样且互补的单元来提升 Transformer 的表达能力。具体而言,我们使用若干并行单元,并表明以多单元建模可改善模型性能并引入多样性。进一步,为更好利用多单元设置的优势,我们设计了偏置模块与序列依赖,以引导并鼓励不同单元间的互补性。在三个机器翻译任务(NIST 中英、WMT'14 英德和 WMT'18 中英)上的实验结果表明,MUTE 模型以仅约 3.1% 的推理速度轻微下降,显著优于 Transformer-Base,提升达 +1.52、+1.90 和 +1.10 BLEU 点。此外,我们的方法仅用其 54% 的参数即超越 Transformer-Big 模型。这些结果证明了 MUTE 的有效性,以及其在推理过程和参数使用上的高效性。
引用
@article{arxiv.2010.10743,
title = {Multi-Unit Transformers for Neural Machine Translation},
author = {Jianhao Yan and Fandong Meng and Jie Zhou},
journal= {arXiv preprint arXiv:2010.10743},
year = {2020}
}
备注
Accepted as a main conference paper in EMNLP 2020