中文

视觉 Transformer 中的 Muon:优化器配方与梯度谱

机器学习 2026-05-26 v1 计算机视觉与模式识别

摘要

Muon 是一种最近开发的面向矩阵的优化器,在 transformer 训练中显示出强劲的性能,但其在视觉 transformer(ViT)中的行为尚不为人所熟知。我们研究 Muon 用于 ViT 训练,主要在 ImageNet-100 和 Pl@ntNet-300K 上进行,比较 AdamW 在包含 mixup、cutmix、smoothing 和随机数据增广与擦除的标准视觉配方下的情况。Muon 在所有情况下都一致地优于 AdamW,尤其在长尾 Pl@ntNet macro top-1 上获得显著提升。这些提升也取决于配方,Muon 从高级且显著的数据增广技术中受益远大于 AdamW。为理解这种相互作用,我们分析了 ViT 中矩阵梯度的奇异值结构。在 Muon 训练过程中,若移除大量数据增广,将导致深度 MLP 下降块中的梯度矩阵出现晚期训练的谱浓缩和模式坍塌。若采用固定的“完整”增广配方,最清晰的 Muon-AdamW 对比则出现在 QKV 梯度上,其中 AdamW 的梯度能量集中于一个更窄的基底,而 Muon 将能量分散到显著更多的奇异模态上。因此,Muon 在 ViT 中最好理解为一种优化器配方的相互作用。在固定配方下,Muon 与 AdamW 最显著的差异出现在注意力投影中,其梯度由更广泛的谱基构成。就 Muon 而言,完整的训练配方对于防止深度前馈块中的晚期谱浓缩和模式坍塌至关重要。我们进一步展示了在图像分割和掩码自编码器模型中使用 Muon 的有效性,Muon 在所考虑的所有设置下均优于 AdamW。

关键词

引用

@article{arxiv.2605.24770,
  title  = {Muon in Vision Transformers: Optimizer-Recipe Interactions and Gradient Spectra},
  author = {Ben S. Southworth and Shuai Jiang and Daniel McBride and Eric C. Cyr and Stephen Thomas},
  journal= {arXiv preprint arXiv:2605.24770},
  year   = {2026}
}

备注

25 pages, 15 figures