谱梯度更新何时有助于深度学习?
机器学习
2026-01-15 v2 最优化与控制
机器学习
摘要
谱梯度方法,如近期流行的 Muon 优化器,是训练深度神经网络和变换器的标准欧几里得梯度下降的有前景替代方案,但目前尚不清楚在哪些条件下它们预期表现更优。我们提出一个简单的逐层条件,用于预测何时谱更新比欧几里得梯度步带来更大的损失下降。该条件对每个参数块,比较梯度的核范数与 Frobenius 范数之比的平方与 incoming 激活的稳定秩。为理解该条件何时可能满足,我们首先证明在随机特征回归、前馈网络和变换器块中,高斯初始化下的激活后矩阵具有低稳定秩。在尖峰随机特征模型中,我们进一步证明经过短暂预热后,欧几里得梯度的核范数与 Frobenius 范数之比随数据维度增长,而激活的稳定秩保持有界,因此谱更新的预测优势随维度缩放。我们在合成回归实验和 NanoGPT 规模语言模型训练中验证了这些预测,发现训练过程中中间激活始终具有低稳定秩,对应梯度保持大的核范数与 Frobenius 范数之比。综合来看,这些结果确定了谱梯度方法(如 Muon)在训练深度网络和变换器中有效的条件。
引用
@article{arxiv.2512.04299,
title = {When do spectral gradient updates help in deep learning?},
author = {Damek Davis and Dmitriy Drusvyatskiy},
journal= {arXiv preprint arXiv:2512.04299},
year = {2026}
}