中文

何时删除 LayerNorm 有助于提高?基于激活约束的 regime 相关隐式正则化

机器学习 2026-04-28 v1 计算与语言

摘要

Dynamic Tanh (DyT) 通过对激活进行界限化来取代 LayerNorm。我们表明,这种界限化是一种与具体训练 regime 相关的隐式正则化器,而非普遍有益的替代方案。在覆盖 64M 至 3.78B 参数、10K 至 118M token 的 GPT-2 系列模型中(并辅以 Llama 与 ViT 的交叉验证),DyT 在 64M/1M 参数/token 组合下可使验证损失降低 27.3%,但在 64M/118M 组合下反而恶化 18.8%;规模为 1M 的优势在模型容量提升后消失(3.78B 参数时仅提升 1.7%),而 118M 的惩罚则扩大至 +27.9%。这种机制是可衡量的:DyT 在 1M 时有 49% 的激活饱和,仅 23% 在 118M 时饱和;基于 500 步饱和启发式方法的分类可在 12 细胞 GPT-2 校准集上达到 75% 的原始样本内准确率(AUC 0.75;加入 Scale 5 压力细胞后为 64%),正确标记了全部 3 个 Llama 检查,但在 leave-one-scale-out 离散测试中仅达到 50%。三项干预措施支持了该约束解释:HardTanh 复刻了该 regime 模式,增加 alpha 在 118M 时单调降低 DyT 的惩罚,vanilla+dropout(p=0.5) 匹配了 DyT 在数据丰富情形下的损失。我们还将 Llama-DyT 的崩溃局部化到 SwiGLU 门控处,在 3-seed 组件消除实验中,饱和将崩溃与收敛分离(r=0.94)。实验范围:所有实验均受计算限制(T/P < 1.84),低于 Chinchilla 最优训练。

关键词

引用

@article{arxiv.2604.23434,
  title  = {When Does Removing LayerNorm Help? Activation Bounding as a Regime-Dependent Implicit Regularizer},
  author = {Lucky Verma},
  journal= {arXiv preprint arXiv:2604.23434},
  year   = {2026}
}

备注

28 pages, 7 figures, includes appendices. Code and artifacts: https://github.com/lucky-verma/dyt-composition-study