中文

Peri-LN:重新审视 Transformer 架构中的归一化层

机器学习 2025-06-09 v3 人工智能 计算与语言

摘要

选择能够稳定训练并加快 Transformer 中层归一化 (LN) 策略的收敛速度,至今仍具有困难性,即便是今天的大型语言模型 (LLM)。我们为理解不同 LN 策略如何影响大规模 Transformer 中的训练动力学提供了全面的分析基础。直到最近,Pre-LN 和 Post-LN 一直主导实践,尽管二者在大规模训练中存在局限性。然而,最近的几个开源模型开始在没有充分解释的情况下静默采用了第三种策略。该策略将归一化层置于子层的外围,我们称之为 Peri-LN。虽然 Peri-LN 已显示出有前景的性能,但其精确机制和优势几乎未被探索。我们的深入分析描绘了 LN 策略的不同行为,揭示了每种放置方式如何塑造激活方差和梯度传播。为验证我们的理论见解,我们在最高达 3.23.2B 参数的 Transformer 上进行了广泛实验,表明 Peri-LN 在方差增长更均衡、梯度流更稳定以及收敛稳定性方面始终优于现有方法。我们的结果表明,Peri-LN 值得在大规模 Transformer 架构中更广泛考虑,为重新审视 LN 的最佳放置提供了新的见解。

关键词

引用

@article{arxiv.2502.02732,
  title  = {Peri-LN: Revisiting Normalization Layer in the Transformer Architecture},
  author = {Jeonghoon Kim and Byeongchan Lee and Cheonbok Park and Yeontaek Oh and Beomjun Kim and Taehwan Yoo and Seongjin Shin and Dongyoon Han and Jinwoo Shin and Kang Min Yoo},
  journal= {arXiv preprint arXiv:2502.02732},
  year   = {2025}
}

备注

ICML2025 Camera-ready version