谱梯度法与Muon方法在多类可分离数据上的隐式偏差
机器学习
2025-12-08 v4 最优化与控制
摘要
不同的梯度方法可用于优化参数充足的模型,虽然它们都可实现零训练误差,但会收敛到截然不同的解,从而导致不同的泛化性能。我们对p范数归一化最速下降(NSD)和动量最速下降(NMD)算法在多类线性分类中以交叉熵损失函数优化的隐式优化偏差提供了第一套完整表征。我们的关键理论贡献在于证明,这些算法收敛到相对于分类器矩阵p范数的max-margin解,并给出了收敛速率。这些结果涵盖了重要的特例,包括谱梯度法(Spectral Descent)和Muon方法,这些方法我们展示会收敛到相对于谱范数(max-norm)的最大边际解。我们贡献的一个关键洞见是,分析一般元素级和Schatten p-范数,可以归约为对NSD/NMD以max-norm为准的分析,通过利用所有p范数相对于max-norm及其对偶和-norm之间天然的排序性质。对于以max-norm为准的下降情况,我们进一步扩展了分析,包括预条件化,显示Adam会收敛到矩阵的max-norm解。我们的结果表明,多类线性设置——这一设置本身比二分类设置更丰富——为研究矩阵参数优化算法的隐式偏差提供了最透明的框架。
引用
@article{arxiv.2502.04664,
title = {Implicit Bias of Spectral Descent and Muon on Multiclass Separable Data},
author = {Chen Fan and Mark Schmidt and Christos Thrampoulidis},
journal= {arXiv preprint arXiv:2502.04664},
year = {2025}
}
备注
NeurIPS 2025 (Spotlight)