自适应优化中结构化预条件器:统一分析
机器学习
2025-07-16 v2
摘要
我们提出了一种针对广泛类自适应优化算法的统一分析,这些算法采用结构化(例如分层、对角线或Kronecker-分解)预条件器,适用于在线 regret 最小化和离线凸优化。我们的分析不仅为包括对角线AdaGrad、全矩阵AdaGrad和AdaGrad-Norm在内的Several重要结构化预条件算法提供匹配的收敛率,还为Shampoo的一个单边变体提供了比原始Shampoo更好的收敛率。有趣的是,尽管使用更结构化的预条件器(例如对角线AdaGrad、AdaGrad-Norm,这些在空间和计算方面更高效),但常被作为全矩阵AdaGrad的计算效率较好的近似值,以期通过更好的近似实现改进的优化性能。我们的统一分析挑战了这种普遍观点,惊讶地揭示了,尽管每一步使用的空间和计算量较少,更结构化的预条件器可能优于其较不结构化的对应物。为证明这一点,我们展示了单边Shampoo相对于全矩阵AdaGrad在理论和实验上都能取得优势。
引用
@article{arxiv.2503.10537,
title = {Structured Preconditioners in Adaptive Optimization: A Unified Analysis},
author = {Shuo Xie and Tianhao Wang and Sashank Reddi and Sanjiv Kumar and Zhiyuan Li},
journal= {arXiv preprint arXiv:2503.10537},
year = {2025}
}
备注
Fix typos and add remarks for two-sided Shampoo