中文

B2T连接:为深层Transformer提供稳定性与性能

机器学习 2023-05-29 v2 计算与语言

摘要

从层归一化(LN)位置的角度,Transformer架构可分为两类:Post-LN与Pre-LN。近期的Transformer倾向于采用Pre-LN,因为在具有深层(如十层及以上)的Post-LN中,训练常不稳定,导致模型无效。然而,在相对浅层(如六层及以下)的Transformer中,Post-LN始终取得优于Pre-LN的性能。本研究首先从经验与理论两方面探究了这些差异现象的原因,并有如下发现:1,Post-LN中的LN是导致梯度消失问题从而引发训练不稳定的主因,而Pre-LN可避免该问题;2,Post-LN在反向传播中倾向于在较高层保持更大的梯度范数,这可能带来有效训练。利用新发现,我们提出一种通过对Post-LN简单修改即可同时提供高稳定性与有效训练的方法。我们在广泛的文本生成任务上开展实验,结果表明该方法优于Pre-LN,且无论浅层或深层设置均能实现稳定训练。我们的代码公开于https://github.com/takase/b2t_connection。

关键词

引用

@article{arxiv.2206.00330,
  title  = {B2T Connection: Serving Stability and Performance in Deep Transformers},
  author = {Sho Takase and Shun Kiyono and Sosuke Kobayashi and Jun Suzuki},
  journal= {arXiv preprint arXiv:2206.00330},
  year   = {2023}
}

备注

Findings of ACL 2023