中文

DNT:一种可用动量SGD训练的深度归一化Transformer

机器学习 2025-07-24 v1 计算与语言 计算机视觉与模式识别

摘要

Transformer已成为现代深度学习的事实骨干,但其训练通常需要像AdamW这样具有自适应学习率的高级优化器,而非动量SGDW(mSGDW)。先前的研究表明,这主要是由于梯度的重尾分布所致。本文引入了一种深度归一化Transformer(DNT),它经过精心设计以克服这一限制,从而能够使用普通的mSGDW进行无缝训练,同时产生与通过AdamW训练的Transformer相当的性能。具体而言,在DNT中,我们策略性地在Transformer的适当位置集成归一化技术,以有效调节每一层的雅可比矩阵,平衡权重、激活及其相互作用的影响,从而使梯度分布集中。我们为DNT中使用的归一化技术提供了理论证明,并在两种流行的Transformer架构上进行了广泛的实证评估,以验证:a) DNT优于其对应模型(即ViT和GPT),b) DNT可以使用普通的mSGDW进行有效训练。

关键词

引用

@article{arxiv.2507.17501,
  title  = {DNT: a Deeply Normalized Transformer that can be trained by Momentum SGD},
  author = {Xianbiao Qi and Marco Chen and Wenjie Xiao and Jiaquan Ye and Yelin He and Chun-Guang Li and Zhouchen Lin},
  journal= {arXiv preprint arXiv:2507.17501},
  year   = {2025}
}

备注

We have introduced a novel architecture, Deeply Normalized Transformer (DNT), which enables efficient training with vanilla momentum SGDW (mSGDW), achieving performance on par with AdamW-optimized Transformers