优化器诱导的模态连通性:从 AdamW 到 Muon
人工智能
2026-05-12 v1 机器学习
最优化与控制
摘要
模态连通性已被广泛研究,但优化器的作用仍未被充分探索。我们通过优化器诱导的隐式正则化重新审视这一问题,探讨当限制于由给定优化器约束的解时,连通性如何表现。对于两层 ReLU 网络,我们证明来自单一优化器(AdamW、Muon 或 Lion- 家族中的其他优化器)的解在足够大的宽度下形成一个连通集,这是先前工作未曾揭示的结果。随后我们刻画了优化器诱导区域如何相互作用:在大宽度下,两个不同区域可以是互不相交的,也可以根据正则化情况发生重叠;而在我们的小宽度示例中,AdamW 和 Muon 收敛到由可证明的损失屏障分隔的不相交零损失组件。在 GPT-2 预训练的实验中,我们观察到同优化器路径保持了每个模型的频谱,而跨优化器路径则经历了平滑过渡。我们的结果揭示了超越经典模态连通性文献的、依赖于优化器的结构。
引用
@article{arxiv.2605.09991,
title = {Optimizer-Induced Mode Connectivity: From AdamW to Muon},
author = {Fangzhao Zhang and Sungyoon Kim and Erica Zhang and Yiqi Jiang and Mert Pilanci},
journal= {arXiv preprint arXiv:2605.09991},
year = {2026}
}