净化Shampoo:通过分解其预条件子研究Shampoo的启发式方法
机器学习
2025-10-30 v2 人工智能
机器学习
摘要
Shampoo在AlgoPerf竞赛中的近期成功引发了人们对基于Kronecker分解的优化算法用于训练神经网络的新兴趣。尽管取得了成功,Shampoo仍然严重依赖多个启发式方法,如学习率嫁接和过时预条件,以实现大规模性能。这些启发式方法增加了算法复杂性,需要进一步超参数调优,并且缺乏理论依据。本文从Frobenius范数逼近全矩阵Adam的角度研究这些启发式方法,并解耦预条件子的特征值和特征基更新。我们证明从Adam嫁接可以缓解预条件子特征值的过时和错误缩放,而直接修正特征值则消除了对学习率嫁接的需求。为了管理因不频繁特征基计算引入的误差,我们提出了一种自适应准则来确定特征基计算频率,其动机来源于终止一个热启动QR算法。该准则解耦了不同预条件子矩阵的更新频率,使我们能够研究逼近误差对收敛的影响。这些实用技术为去除Shampoo的启发式方法和开发改进的基于Kronecker分解的训练算法提供了原则性角度。
引用
@article{arxiv.2506.03595,
title = {Purifying Shampoo: Investigating Shampoo's Heuristics by Decomposing its Preconditioner},
author = {Runa Eschenhagen and Aaron Defazio and Tsung-Hsien Lee and Richard E. Turner and Hao-Jun Michael Shi},
journal= {arXiv preprint arXiv:2506.03595},
year = {2025}
}
备注
NeurIPS 2025