中文

无捷径的深度 Transformer:改进自注意力以实现忠实信号传播

机器学习 2023-02-22 v1 人工智能 计算与语言 机器学习

摘要

残差连接与归一化层是深度神经网络(DNN)训练中无处不在的两类标准架构组件,但其精确作用却鲜为人知。近期如深度核整形(Deep Kernel Shaping)等方法借助宽神经网络核理论改进 vanilla DNN(我们定义为无残差与无归一化的网络)中的信号传播,在减少对其依赖上取得进展。然而,这些方法与 transformer 中存在的自注意力层不兼容,后者的核本质上更复杂而难以分析控制。因此问题依然存在:能否训练深度 vanilla transformer?我们肯定地回答了该问题,设计了若干方法,运用参数初始化、偏置矩阵与位置相关重缩放的组合,在 vanilla transformer 中实现忠实信号传播。我们的方法解决了 transformer 中信号传播特有的若干复杂性,包括与位置编码及因果掩码的交互。在 WikiText-103 与 C4 上的实验中,我们的方法使无归一化的深度 transformer 以匹配标准对应模型的速度训练,并使深度 vanilla transformer 在约多 5 倍迭代后达到与标准模型相同的性能。

关键词

引用

@article{arxiv.2302.10322,
  title  = {Deep Transformers without Shortcuts: Modifying Self-attention for Faithful Signal Propagation},
  author = {Bobby He and James Martens and Guodong Zhang and Aleksandar Botev and Andrew Brock and Samuel L Smith and Yee Whye Teh},
  journal= {arXiv preprint arXiv:2302.10322},
  year   = {2023}
}

备注

ICLR 2023