Post-LayerNorm 的回归:稳定、高表达力与深度扩展
机器学习
2026-02-02 v2 计算与语言
摘要
大语言模型 (LLM) 的扩展正遭遇瓶颈。加宽模型带来的收益递减,而延长上下文长度并不能提升基础表达能力。相比之下,深度扩展在理论上提供了更优的表达能力,然而当前的 Transformer 架构在极端深度下难以可靠地训练。我们重新审视了 Post-LayerNorm (Post-LN) 公式,其在大规模下的不稳定性导致其在现代 LLM 中被 Pre-LN 取代。我们表明,Post-LN 的核心失效模式源于 ResNet 风格的残差路径,该路径在深层网络中引发梯度消失。我们提出了 Keel,一种 Post-LN Transformer,它用 Highway 风格的连接替换了该残差路径。这一修改保留了通过残差分支的梯度流,防止了信号从顶层向底层消失。与先前的方法不同,Keel 无需专门的初始化或复杂的优化技巧,即可在极端深度下实现稳定训练。Keel 在超过 1000 层的深度下稳健地训练,并在困惑度和深度扩展特性上持续优于 Pre-LN。这些发现表明,Post-LN 与 Highway 风格连接相结合,为构建深度可扩展的 LLM 提供了简单而有效的基础,为未来的无限深度架构开启了可能。
引用
@article{arxiv.2601.19895,
title = {Post-LayerNorm Is Back: Stable, ExpressivE, and Deep},
author = {Chen Chen and Lai Wei},
journal= {arXiv preprint arXiv:2601.19895},
year = {2026}
}