中文

你的优化器在意你如何归一化吗?LLM 训练中的归一化-优化器耦合

人工智能 2026-04-03 v1 机器学习

摘要

在 LLM 训练中,归一化层与优化器通常被视为独立的设计选择。我们在 1B 参数、1000 个训练步的 3×2 因子实验中表明,这一假设可能不成立:Dynamic Erf(Derf;Chen & Liu, 2025)与 Muon(Jordan, 2024)之间存在显著的负交互效应,其相对于 RMSNorm 的差距从 AdamW 下的 +0.31 nats 扩大到 Muon 下的 +0.97 nats,约三倍。作为有界归一化器的对照,Dynamic Tanh(DyT;Zhu et al., 2025)未表现出此类惩罚。我们的证据表明,erf 在 Muon 更快的谱范数增长下存在两种失效模式:饱和(有损压缩)和尺度盲性(丢弃激活幅度)。一种重新引入运行尺度估计的 EMA 混合方法可恢复约 84% 的差距。另外,将 Derf 的 alpha 从已发表默认值(0.5)降至 0.3 也可恢复约 80%,因为这使 erf 保持在近似线性区间,从而近似保持相对尺度;该设置并非 Chen & Liu (2025) 的已发布默认值。使用 Derf 的已发布默认 alpha 配合 Muon 会产生 0.66 nats 的交互惩罚,但不会产生 NaN 或发散,因此在短试运行中很容易被忽略。

关键词

引用

@article{arxiv.2604.01563,
  title  = {Does Your Optimizer Care How You Normalize? Normalization-Optimizer Coupling in LLM Training},
  author = {Abdelrahman Abouzeid},
  journal= {arXiv preprint arXiv:2604.01563},
  year   = {2026}
}

备注

16 pages, 8 figures. Preprint. Under review