中文

Exact Attention Sensitivity and the Geometry of Transformer Stability

机器学习 2026-02-24 v1 人工智能

摘要

尽管变压器正在为现代AI提供动力,但变压器在训练时仍然神秘地脆弱。我们发展了一种稳定性理论,从第一原理解释为何pre-LayerNorm有效,为何DeepNorm使用N1/4N^{-1/4}缩放,以及为何需要预热。我们的框架包含两个支柱:(1)我们推导了softmax Jacobian的确切算子范数,Jsoftmax(u/τ)1=θ(p)/τ\|J_{softmax}(u/\tau)\|_{\infty\to 1} = \theta(p)/\tau,其中平衡质量因子θ(p)[0,1]\theta(p)\in[0,1]量化了注意力灵敏度。(2)我们引入一种与token级计算对齐的block-\infty/RMS几何,得到序列长度无关的Lipschitz界限。使用这个框架,我们证明了pre-LN保持恒等梯度路径,而post-LN会随深度指数性地放大LayerNorm Jacobian,我们展示了DeepNorm的N1/4N^{-1/4}源于注意力四个投影矩阵的四次结构。我们在7740万参数模型上验证了理论,发现与注意力在训练中变得更锐利以减少灵敏度的直觉相反,θ(p)1\theta(p) \approx 1在整个训练过程中保持不变。变压器的稳定性完全来自架构的梯度流,而非来自注意力动态。这一发现改变了我们对训练的思考方式:架构本身必须处理灵敏度,而非学习到的注意力模式。

关键词

引用

@article{arxiv.2602.18849,
  title  = {Exact Attention Sensitivity and the Geometry of Transformer Stability},
  author = {Seyed Morteza Emadi},
  journal= {arXiv preprint arXiv:2602.18849},
  year   = {2026}
}

备注

18 pages, 6 figures