Bounded Hyperbolic Tangent: A Stable and Efficient Alternative to Pre-Layer Normalization in Large Language Models
计算与语言
2026-02-04 v2 人工智能
摘要
前置层归一化(Pre-LN)是大语言模型(LLM)的事实标准选择,对于稳定预训练和有效迁移学习至关重要。然而,Pre-LN 因重复的统计计算而效率低下,并遭受深度诅咒。随着层数增加,隐藏状态的幅度和方差会升级,导致训练不稳定。以效率为导向的无归一化方法,如动态双曲正切(DyT),虽能提高速度,但在深度较大时仍显脆弱。为同时解决稳定性和效率问题,我们提出了有界双曲正切(BHyT),作为 Pre-LN 的直接替代方案。BHyT 将 tanh 非线性与显式的、数据驱动的输入有界化相结合,使激活值保持在非饱和范围内。它防止了激活幅度和方差的逐层增长,并具有理论稳定性保证。在效率方面,BHyT 每个块仅计算一次精确统计量,并用轻量级方差近似替代第二次归一化,从而提升效率。实验证明,BHyT 在预训练期间展现出更高的稳定性和效率,与 RMSNorm 相比,平均训练速度提升 15.8%,平均 token 生成吞吐量提高 4.2%,同时在语言理解和推理基准上的推理性能和鲁棒性与之持平或更优。我们的代码可在 https://anonymous.4open.science/r/BHyT 获取。
引用
@article{arxiv.2601.09719,
title = {Bounded Hyperbolic Tangent: A Stable and Efficient Alternative to Pre-Layer Normalization in Large Language Models},
author = {Hoyoon Byun and Youngjun Choi and Taero Kim and Sungrae Park and Kyungwoo Song},
journal= {arXiv preprint arXiv:2601.09719},
year = {2026}
}