Exact Attention Sensitivity and the Geometry of Transformer Stability
机器学习
2026-02-24 v1 人工智能
摘要
尽管变压器正在为现代AI提供动力,但变压器在训练时仍然神秘地脆弱。我们发展了一种稳定性理论,从第一原理解释为何pre-LayerNorm有效,为何DeepNorm使用缩放,以及为何需要预热。我们的框架包含两个支柱:(1)我们推导了softmax Jacobian的确切算子范数,,其中平衡质量因子量化了注意力灵敏度。(2)我们引入一种与token级计算对齐的block-/RMS几何,得到序列长度无关的Lipschitz界限。使用这个框架,我们证明了pre-LN保持恒等梯度路径,而post-LN会随深度指数性地放大LayerNorm Jacobian,我们展示了DeepNorm的源于注意力四个投影矩阵的四次结构。我们在7740万参数模型上验证了理论,发现与注意力在训练中变得更锐利以减少灵敏度的直觉相反,在整个训练过程中保持不变。变压器的稳定性完全来自架构的梯度流,而非来自注意力动态。这一发现改变了我们对训练的思考方式:架构本身必须处理灵敏度,而非学习到的注意力模式。
引用
@article{arxiv.2602.18849,
title = {Exact Attention Sensitivity and the Geometry of Transformer Stability},
author = {Seyed Morteza Emadi},
journal= {arXiv preprint arXiv:2602.18849},
year = {2026}
}
备注
18 pages, 6 figures