中文

净化Shampoo:通过分解其预条件子研究Shampoo的启发式方法

机器学习 2025-10-30 v2 人工智能 机器学习

摘要

Shampoo在AlgoPerf竞赛中的近期成功引发了人们对基于Kronecker分解的优化算法用于训练神经网络的新兴趣。尽管取得了成功,Shampoo仍然严重依赖多个启发式方法,如学习率嫁接和过时预条件,以实现大规模性能。这些启发式方法增加了算法复杂性,需要进一步超参数调优,并且缺乏理论依据。本文从Frobenius范数逼近全矩阵Adam的角度研究这些启发式方法,并解耦预条件子的特征值和特征基更新。我们证明从Adam嫁接可以缓解预条件子特征值的过时和错误缩放,而直接修正特征值则消除了对学习率嫁接的需求。为了管理因不频繁特征基计算引入的误差,我们提出了一种自适应准则来确定特征基计算频率,其动机来源于终止一个热启动QR算法。该准则解耦了不同预条件子矩阵的更新频率,使我们能够研究逼近误差对收敛的影响。这些实用技术为去除Shampoo的启发式方法和开发改进的基于Kronecker分解的训练算法提供了原则性角度。

关键词

引用

@article{arxiv.2506.03595,
  title  = {Purifying Shampoo: Investigating Shampoo's Heuristics by Decomposing its Preconditioner},
  author = {Runa Eschenhagen and Aaron Defazio and Tsung-Hsien Lee and Richard E. Turner and Hao-Jun Michael Shi},
  journal= {arXiv preprint arXiv:2506.03595},
  year   = {2025}
}

备注

NeurIPS 2025