大语言模型中的深度之诅
机器学习
2026-02-24 v5 人工智能
摘要
本文介绍了深度之诅,这一概念旨在突出、解释和解决近期观察到的现象,即现代大语言模型(LLM)中近一半的层的有效性低于预期。我们首先在最流行的LLM家族中广泛确认了这一现象,如Llama、Mistral、DeepSeek和Qwen。我们的分析从理论和实证两个角度确定了深层LLM层不有效的根本原因是Pre-Layer Normalization(Pre-LN)的广泛使用。虽然Pre-LN稳定了Transformer LLM的训练,但其输出方差随模型深度指数级增长,这不利地导致深层Transformer块的导数趋于单位矩阵,从而几乎不为训练贡献。为解决这一训练困境,我们提出了LayerNorm Scaling(LNS),该方法按深度的平方根的倒数来缩放层归一化的输出方差。这种简单的修改缓解了更深层Transformer层的输出方差爆炸问题,提高了它们的贡献。我们在130M至7B的广泛模型规模范围内的实验表明,LNS在增强LLM预训练性能方面 consistently 优于以往的归一化和缩放技术。此外,这种改进无缝地延续到了监督微调。所有这些收益归功于LayerNorm Scaling使更深层的层在训练期间能够更有效地贡献。我们的代码可在\href{https://github.com/lmsdss/LayerNorm-Scaling}{LayerNorm-Scaling}获取。
引用
@article{arxiv.2502.05795,
title = {The Curse of Depth in Large Language Models},
author = {Wenfang Sun and Xinyuan Song and Pengxiang Li and Lu Yin and Yefeng Zheng and Shiwei Liu},
journal= {arXiv preprint arXiv:2502.05795},
year = {2026}
}
备注
Accepted by NeurIPS 2025