澄清 Shampoo:适应性谱下降与随机性及参数轨迹
机器学习
2026-02-11 v1 人工智能
机器学习
摘要
利用神经网络中矩阵结构的优化器,如 Shampoo 和 Muon,比基于元素级算法(如 Adam 和 Signum)更高效。虽然在特定情境下,Shampoo 和 Muon 可简化为谱下降(spectral descent),而 Adam 和 Signum 可简化为符号下降(sign descent),但其一般关系及在受控情境下的相对数据效率尚不明了。通过在语言模型上的大量实验,我们展示 Shampoo 在获取 token 效率上优于 Muon,镜像 Adam 对 Signum 的优势。我们指出,Shampoo 对权重矩阵的更新可分解为适应性 Muon 更新。一致于此,Shampoo 的优势可完全归因于其针对权重矩阵的应用,挑战了不考虑参数形状的解释。这为一种新视角提供了可能,同时也规避了基于方差适应和白化的相关解释的局限:不像谱下降强制实现半正交性,Shampoo 的更新在预期意义上是时间平均的半正交。
引用
@article{arxiv.2602.09314,
title = {Clarifying Shampoo: Adapting Spectral Descent to Stochasticity and the Parameter Trajectory},
author = {Runa Eschenhagen and Anna Cai and Tsung-Hsien Lee and Hao-Jun Michael Shi},
journal= {arXiv preprint arXiv:2602.09314},
year = {2026}
}