更强的无归一化 Transformer
机器学习
2026-04-01 v2 人工智能
计算与语言
计算机视觉与模式识别
摘要
尽管归一化层长期以来被视为深度学习架构中不可或缺的组件,但近期提出的动态 Tanh(DyT)表明替代方案是可行的。该逐点函数 DyT 通过约束极端值实现稳定收敛,并达到归一化级别的性能;本研究进一步寻求能够超越它的函数设计。我们首先研究了逐点函数的内在属性如何影响训练与性能。基于这些发现,我们进行了大规模的函数设计搜索。通过这一探索,我们引入了 ,其中 是重缩放的 Gaussian 累积分布函数,并将其识别为性能最优的设计。Derf 在广泛领域中超越了 LayerNorm、RMSNorm 和 DyT,包括视觉识别与生成、语音表征和 DNA 序列建模。我们的分析还表明,Derf 的性能提升主要源于其更好的泛化能力而非更强的拟合能力。其简洁性和更强的性能使 Derf 成为无归一化 Transformer 架构的实用选择。
引用
@article{arxiv.2512.10938,
title = {Stronger Normalization-Free Transformers},
author = {Mingzhi Chen and Taiming Lu and Jiachen Zhu and Mingjie Sun and Zhuang Liu},
journal= {arXiv preprint arXiv:2512.10938},
year = {2026}
}
备注
Published in CVPR 2026