通过平均注意力网络加速神经 Transformer
计算与语言
2018-05-08 v3
摘要
凭借可并行化的注意力网络,神经 Transformer 训练非常快。然而,由于解码器中的自回归架构与自注意力,解码过程变得缓慢。为缓解此问题,我们提出一种平均注意力网络,作为神经 Transformer 解码器中自注意力网络的替代。平均注意力网络由两层组成:一个对先前位置依赖关系建模的平均层,以及一个堆叠在平均层之上以增强所提注意力网络表达能力的门控层。我们将该网络应用于神经 Transformer 的解码器部分,以替换原有的目标端自注意力模型。借助掩码技巧与动态规划,我们的模型使神经 Transformer 的解码速度较原始版本提升四倍以上,且在训练时间与翻译性能上几乎无损失。我们在 WMT17 翻译任务上进行了一系列实验,在 6 个不同语言对上获得了稳健且一致的解码加速。
引用
@article{arxiv.1805.00631,
title = {Accelerating Neural Transformer via an Average Attention Network},
author = {Biao Zhang and Deyi Xiong and Jinsong Su},
journal= {arXiv preprint arXiv:1805.00631},
year = {2018}
}
备注
ACL 2018, long paper