归一化自由 Transformer 初始化时的亚临界信号传播
机器学习
2026-05-08 v3 机器学习
摘要
我们通过平均部分雅可比范数(APJN)——一种衡量跨层梯度放大程度的量 ——研究 Transformer 在初始化时的信号传播。我们推导了具有双向注意力和排列对称输入 token 配置的 Transformer 的 APJN 分析,并通过推导激活统计量和跨层 APJN 的递推关系,扩展了 APJN 分析。我们的理论预测注意力如何影响深度较大时的 APJN 的渐近行为,并与深层视觉 Transformer 中测量的 APJN 相吻合。已知的残差网络中的临界性图景也适用于 Transformer:预 LayerNorm 架构表现出幂律 APJN 增长,而使用类似 的逐元素非线性取代 LayerNorm 的 Transformer 表现出 stretched-exponential APJN 增长,表明后者是亚临界的。应用于 Dynamic Tanh(DyT) 和 Dynamic erf(Derf) Transformer 时,理论解释了这些架构为何对初始化和优化选择更敏感,需要谨慎调谐才能实现稳定训练。
引用
@article{arxiv.2604.11890,
title = {Subcritical Signal Propagation at Initialization in Normalization-Free Transformers},
author = {Sergey Alekseev},
journal= {arXiv preprint arXiv:2604.11890},
year = {2026}
}
备注
Minor text edits; 10 pages of main text; 34 pages total; 5 figures in the main text, 25 figures total; preprint