中文

关于带残差连接的Transformer模型梯度下降收敛性

机器学习 2026-04-14 v4 最优化与控制

摘要

Transformer 模型已成为跨越多个科学和工程领域的基础工具,凭借在多种应用中的卓越性能受到广泛关注。尽管如此,Transformer 的理论基础仍相对不成熟,尤其是在理解其训练动力学方面。现有研究主要考察孤立组件——如自注意力机制和前馈网络——而不深入探讨这些组件之间的相互作用,特别是在残差连接存在的情况下。本文旨在填补这一空白,通过分析包含自注意力、前馈网络和残差连接的结构完整单层Transformer的收敛行为。我们证明,在恰当的初始化下,梯度下降具有线性收敛率,其中收敛速度由注意力层输出矩阵的最小与最大奇异值决定。此外,我们的分析揭示,残差连接能够缓解该输出矩阵的病态问题——这一问题源于softmax操作所施加的低秩结构,从而促进优化稳定性。我们还将理论结果推广到多层Transformer架构,确认在合适的初始化下,梯度下降仍具有线性收敛率。实验结果也支持我们的理论见解,说明残差连接在促进收敛稳定性方面具有积极作用。

关键词

引用

@article{arxiv.2506.05249,
  title  = {On the Convergence of Gradient Descent on Learning Transformers with Residual Connections},
  author = {Zhen Qin and Jinxin Zhou and Jiachen Jiang and Zhihui Zhu},
  journal= {arXiv preprint arXiv:2506.05249},
  year   = {2026}
}