深度 Transformer 的 Lipschitz 约束参数初始化
计算与语言
2020-05-06 v2 音频与语音处理
摘要
Transformer 翻译模型采用残差连接和层归一化来缓解其多层编码器/解码器结构引起的优化困难。先前研究表明,即便有残差连接和层归一化,深度 Transformer 仍难以训练,尤其是层数超过 12 层的编码器/解码器 Transformer 模型无法收敛。本文中,我们首先通过实验证明,对官方实现所做的一个简单修改——改变残差连接与层归一化的计算顺序——可显著缓解深度 Transformer 的优化。我们随后详细比较了计算顺序中的细微差异,并提出了一种利用 Lipschitz 约束对 Transformer 参数初始化进行约束的参数初始化方法,有效确保了训练收敛。与先前研究结论相反,我们进一步证明,在 Lipschitz 参数初始化下,采用原始计算顺序的深度 Transformer 能够收敛,并在最多 24 层时获得显著的 BLEU 提升。与聚焦于深度编码器的先前研究不同,我们的方法还使 Transformer 能从深度解码器中获益。
引用
@article{arxiv.1911.03179,
title = {Lipschitz Constrained Parameter Initialization for Deep Transformers},
author = {Hongfei Xu and Qiuhui Liu and Josef van Genabith and Deyi Xiong and Jingyi Zhang},
journal= {arXiv preprint arXiv:1911.03179},
year = {2020}
}