中文

SiameseNorm:突破 Pre/Post-Norm 之间的鸿沟

机器学习 2026-05-22 v2 人工智能 计算与语言

摘要

Pre-与 Post-Norm 之间的长期矛盾仍是 Transformer 架构中的开放问题,反映了训练稳定性和表示容量之间的根本性权衡。先前的尝试已取得进展,但往往显示出在不同训练设置下的有限鲁棒性,限制了其更广泛的适用性。我们重新审视这一困境,发现单流体系结构在 Reconcile Pre-Norm 的稳定恒等梯度传递与 Post-Norm 对主残差路径归一化方面存在挑战。为解决这一结构性矛盾,我们提出了 SiameseNorm,一种简单而有效的双流体系结构,能够与 Pre-Norm 训练配方保持兼容。SiameseNorm 通过共享残差块将 Pre-Norm 类和 Post-Norm 类流耦合,使每个残差块都能从两个路径获得优化信号,开销可忽略不计。对 4.0 亿参数和 130 亿参数稠密语言模型、150 亿参数 MoE 模型、Vision Transformer 和 Diffusion Transformer 进行大量实验表明,SiameseNorm 在各种体系结构和模态下均能在保持强训练稳定性的同时持续提升性能。代码已公开 https://github.com/Qwen-Applications/SiameseNorm。

关键词

引用

@article{arxiv.2602.08064,
  title  = {SiameseNorm: Breaking the Barrier to Reconciling Pre/Post-Norm},
  author = {Tianyu Li and Dongchen Han and Zixuan Cao and Haofeng Huang and Mengyu Zhou and Ming Chen and Erchao Zhao and Xiaoxi Jiang and Guanjun Jiang and Gao Huang},
  journal= {arXiv preprint arXiv:2602.08064},
  year   = {2026}
}

备注

Accepted to ICML 2026; camera-ready version; revised presentation and added additional experimental results