SeeDNorm:自动态归一化
机器学习
2026-02-12 v3
摘要
归一化层是神经网络中的 essential 组件。在 transformer 中,主要使用的 RMSNorm 将向量约束到单位超球面,然后通过可学习的尺度系数 进行维度级尺度缩放,以保持模型的表示能力。然而,RMSNorm 在前向传播中丢弃了输入范数信息,而静态尺度系数 可能不足以适应输入数据和分布迁移的广泛变化,从而限制了进一步的性能提升,尤其是在大型语言模型常遇到的零样本情形下。为此,我们提出了 SeeDNorm,通过基于当前输入动态调整尺度系数来增强模型的表示能力,从而保留输入范数信息并实现数据依赖的、自我动态归一化。在反向传播期间,SeeDNorm 保留了 RMSNorm 能够根据输入范数动态调整梯度的能力。我们对 SeedNorm 的训练优化进行了详细分析,并提出了相应的解决方案以解决在应用 SeeDNorm 时可能出现的不稳定问题。我们在大型语言模型预训练以及监督和无监督计算机视觉任务中验证了 SeeDNorm 的有效性。通过引入极少的额外参数并对模型效率影响可忽略,SeeDNorm 在之前常用的归一化层(如 RMSNorm 和 LayerNorm)以及以元素级激活替代归一化层的 DyT 等方面均实现了持续优异的性能。
引用
@article{arxiv.2510.22777,
title = {SeeDNorm: Self-Rescaled Dynamic Normalization},
author = {Wenrui Cai and Defa Zhu and Qingjie Liu and Qiyang Min},
journal= {arXiv preprint arXiv:2510.22777},
year = {2026}
}
备注
Accepted to ICLR 2026, 32 pages, 14 figures, 18 tables