中文

Drop-Muon:更新更少,收敛更快

机器学习 2025-10-03 v1 最优化与控制 机器学习

摘要

深度学习优化中的传统智慧指导每一步更新所有层——这是所有近期最先进优化器(如 Muon)遵循的原则。在本工作中,我们挑战这一假设,表明全网络更新在理论上和实践中都可能从根本上次优。我们提出一种非欧几里得随机渐进训练方法——Drop-Muon——一个简单而强大的框架,根据随机调度每步仅更新一个子集层,将渐进训练的效率与逐层的非欧几里得更新相结合,以实现顶级性能。我们在逐层平滑性和逐层 (L0,L1)(L^0, L^1)-平滑性条件下提供了严格的收敛保证,覆盖了确定性和随机梯度设置,标志着随机和非平滑区域渐进训练的首个此类结果。我们的成本分析进一步揭示,除非层平滑常数之间存在非常特定的关系,否则全网络更新并非最优。通过受控的 CNN 实验,我们在经验上证明 Drop-Muon 持续优于全网络 Muon,以高达 1.4×1.4\times 的壁钟时间达到相同的准确率。综合来看,我们的结果表明大规模模型可以如何被高效训练,挑战现状并提供一种理论上有据的高效全网络更新的替代方案。

关键词

引用

@article{arxiv.2510.02239,
  title  = {Drop-Muon: Update Less, Converge Faster},
  author = {Kaja Gruntkowska and Yassine Maziane and Zheng Qu and Peter Richtárik},
  journal= {arXiv preprint arXiv:2510.02239},
  year   = {2025}
}