中文

阐明谱感设计对泛化的优势:基于不平衡数据的研究

机器学习 2025-12-15 v3 机器学习

摘要

谱感矩阵值优化器(如 Muon 和 Shampoo)在深度学习中的日益普及激发了对其泛化特性的系统性研究,尤其是何时可能优于竞争算法。我们通过引入恰当的简化抽象来回答此问:第一,我们将不平衡数据作为测试基准。第二,我们研究此类优化器的标准形式,即谱梯度下降(SpecGD)——每一步更新均为 UVTUV^T,其中 UΣVTU\Sigma V^T 为梯度的截断奇异值分解。第三,在此框架下,我们识别了一种标准设置,精确量化了 SpecGD 在何时优于标准欧几里得梯度下降。对于高斯混合数据模型及线性和双线性模型,我们指出:与梯度下降(GD)优先学习数据主成分的做法不同,SpecGD 在等速率下学习数据的所有主成分。我们展示了这如何转化为在类别平衡损失中为 SpecGD 所优势的扩大范围,并进一步表明,即使 GD 配合通过归一化实现的自适应步长,优势仍保持一致。通过扩展至深层线性模型,我们表明深度会放大这些效应。我们在多种不平衡数据集上进行经验验证,验证了理论发现。我们的实验将实际的谱方法变体(如 Muon 和 Shampoo)与其欧几里得对手及 Adam 进行比较。结果确认这些谱优化器通过促进数据底层成分的更平衡学习,实现了优越的泛化。

关键词

引用

@article{arxiv.2510.22980,
  title  = {How Muon's Spectral Design Benefits Generalization: A Study on Imbalanced Data},
  author = {Bhavya Vasudeva and Puneesh Deora and Yize Zhao and Vatsal Sharan and Christos Thrampoulidis},
  journal= {arXiv preprint arXiv:2510.22980},
  year   = {2025}
}

备注

36 pages, 32 figures, 1 table