中文

归一化自由 Transformer 初始化时的亚临界信号传播

机器学习 2026-05-08 v3 机器学习

摘要

我们通过平均部分雅可比范数(APJN)——一种衡量跨层梯度放大程度的量 ——研究 Transformer 在初始化时的信号传播。我们推导了具有双向注意力和排列对称输入 token 配置的 Transformer 的 APJN 分析,并通过推导激活统计量和跨层 APJN 的递推关系,扩展了 APJN 分析。我们的理论预测注意力如何影响深度较大时的 APJN 的渐近行为,并与深层视觉 Transformer 中测量的 APJN 相吻合。已知的残差网络中的临界性图景也适用于 Transformer:预 LayerNorm 架构表现出幂律 APJN 增长,而使用类似 tanh\tanh 的逐元素非线性取代 LayerNorm 的 Transformer 表现出 stretched-exponential APJN 增长,表明后者是亚临界的。应用于 Dynamic Tanh(DyT) 和 Dynamic erf(Derf) Transformer 时,理论解释了这些架构为何对初始化和优化选择更敏感,需要谨慎调谐才能实现稳定训练。

关键词

引用

@article{arxiv.2604.11890,
  title  = {Subcritical Signal Propagation at Initialization in Normalization-Free Transformers},
  author = {Sergey Alekseev},
  journal= {arXiv preprint arXiv:2604.11890},
  year   = {2026}
}

备注

Minor text edits; 10 pages of main text; 34 pages total; 5 figures in the main text, 25 figures total; preprint