加速梯度下降优化与正则化的预条件化
机器学习
2025-12-30 v2 数值分析
数值分析
机器学习
摘要
加速训练算法(如自适应学习率或预条件化,以及各种归一化方法)广泛使用,但并未得到完全理解。当引入正则化时,标准优化器(如自适应学习率)可能无法有效工作。这引出了替代性正则化方法(如AdamW)的需求,以及如何正确地将正则化与预条件化结合起来的问题。本文通过预条件化理论来应对这些挑战:(1)我们解释了AdaGrad、RMSProp和Adam通过改善Hessian条件数来加速训练;(2)我们探讨了L2正则化与预条件化之间的相互作用,表明AdamW相当于为正则化选择底层内在参数,我们还推导出L1正则化的推广;(3)我们表明各种归一化方法(如输入数据归一化、批量归一化和层归一化)通过改善Hessian条件数来加速训练。我们的分析为理解各种加速技术或推导合适的正则化方案提供了统一的数学框架。
关键词
引用
@article{arxiv.2410.00232,
title = {Preconditioning for Accelerated Gradient Descent Optimization and Regularization},
author = {Qiang Ye},
journal= {arXiv preprint arXiv:2410.00232},
year = {2025}
}
备注
21 pages