中文

无归一化的Transformer

机器学习 2025-06-17 v2 人工智能 计算与语言 计算机视觉与模式识别

摘要

归一化层在现代神经网络中无处不在,长期以来一直被视为必不可少的组件。本工作表明,无需归一化的Transformer能够通过一种极其简洁的技术实现相同或更好的性能。我们引入Dynamic Tanh (DyT),一种元素级操作DyT(DyT(x)=tanh(α) = \tanh(\alpha x)),作为Transformer中归一化层的即插即用替代方案。DyT灵感来自观察到Transformer中的层归一化常常产生类似tanh的、S形输入输出映射。通过引入DyT,无归一化的Transformer能够匹配或超越其带归一化版本的性能,大多数情况下无需进行超参数调优。我们在从识别到生成、从监督学习到自监督学习、从计算机视觉到语言模型等多种设置下验证了带DyT的Transformer的有效性。这些发现挑战了归一化层在现代神经网络中不可或缺这一传统观念,为深入理解其在深度网络中的作用提供了新视角。

关键词

引用

@article{arxiv.2503.10622,
  title  = {Transformers without Normalization},
  author = {Jiachen Zhu and Xinlei Chen and Kaiming He and Yann LeCun and Zhuang Liu},
  journal= {arXiv preprint arXiv:2503.10622},
  year   = {2025}
}

备注

CVPR 2025; Project page: https://jiachenzhu.github.io/DyT/