通过深度缩放初始化与合并注意力改进深层 Transformer
计算与语言
2019-08-30 v1
摘要
NLP领域的总体趋势是通过更深的神经网络来增加模型容量和性能。然而,简单地堆叠更多层流行的Transformer架构用于机器翻译会导致收敛性差和计算开销高。我们的实证分析表明,收敛性差是由于残差连接与层归一化之间的相互作用引起的梯度消失所致。我们提出深度缩放初始化(DS-Init),它在初始化阶段降低参数方差,并减小残差连接的输出方差,从而缓解通过归一化层的梯度反向传播。为解决计算成本问题,我们提出一种合并注意力子层(MAtt),它将简化的基于平均的自注意力子层与解码器侧的编码器-解码器注意力子层相结合。在具有五个翻译方向的WMT和IWSLT翻译任务上的结果表明,带有DS-Init和MAtt的深层Transformer在BLEU上可大幅优于其基础对应模型(12层模型平均+1.1 BLEU),同时由于MAtt的效率改进而匹配基线模型的解码速度。
引用
@article{arxiv.1908.11365,
title = {Improving Deep Transformer with Depth-Scaled Initialization and Merged Attention},
author = {Biao Zhang and Ivan Titov and Rico Sennrich},
journal= {arXiv preprint arXiv:1908.11365},
year = {2019}
}
备注
EMNLP2019