中文

SpanNorm:深层 Transformer 中训练稳定性与性能的统一方法

计算与语言 2026-02-02 v1 人工智能 机器学习

摘要

大型语言模型 (LLM) 的成功离不开深层 Transformer 架构的稳定训练。一个关键设计选择是归一化层的位置,导致出现根本性权衡:``PreNorm'' 架构确保训练稳定性,但以潜在的性能下降为代价;``PostNorm'' 架构提供强大的性能,但 suffer于严重的训练不稳定。在本工作中,我们提出 SpanNorm,这是一种新颖技术,旨在通过整合两者优点来解决这一困境。结构上,SpanNorm 在整个 Transformer 模块中建立干净的残差连接以稳定信号传播,同时采用 PostNorm 风格的计算对聚合输出进行归一化,以增强模型性能。我们提供了理论分析,表明 SpanNorm 结合原则性的缩放策略可在整个网络中保持信号方差受限,从而防止 PostNorm 模型中常见的梯度问题,并也缓解了 PreNorm 的表示塌陷。实验上,SpanNorm 在密集和混合专家 (MoE) 场景中均优于标准归一化方案,为更强大和稳定的 Transformer 架构铺平了道路。

关键词

引用

@article{arxiv.2601.22580,
  title  = {SpanNorm: Reconciling Training Stability and Performance in Deep Transformers},
  author = {Chao Wang and Bei Li and Jiaqi Zhang and Xinyu Liu and Yuchun Fan and Linkun Lyu and Xin Chen and Jingang Wang and Tong Xiao and Peng Pei and Xunliang Cai},
  journal= {arXiv preprint arXiv:2601.22580},
  year   = {2026}
}