Stacey:通过加速的 $\ell_p$ 光滑非凸优化推动随机最陡下降
机器学习
2025-06-11 v1
摘要
虽然SGD、AdamW 和 Lion 等流行的优化方法依赖于 或 范数中的最陰下降更新,但在处理现代深度网络训练中观察到的非欧几里得结构方面仍存在关键差距。本文通过引入一种名为 Stacey 的新型加速 最陰下降算法来解决这一需求,该算法使用插值 primal-dual 迭代序列有效地导航非欧几里得光滑优化任务。除了为我们的算法提供新的理论保证之外,我们还在包括图像分类和语言模型(LLM)预训练等任务上与这些流行方法进行了经验比较,表明我们的做法实现了更快的收敛速度和更高的最终准确率。我们进一步评估了不同 值在各种模型和数据集上的应用,凸显了非欧几里得方法在速度和效率方面优于标准欧几里得方法的重要性。代码可在 https://github.com/xinyuluo8561/Stacey 上获取。
引用
@article{arxiv.2506.06606,
title = {Stacey: Promoting Stochastic Steepest Descent via Accelerated $\ell_p$-Smooth Nonconvex Optimization},
author = {Xinyu Luo and Cedar Site Bai and Bolian Li and Petros Drineas and Ruqi Zhang and Brian Bullins},
journal= {arXiv preprint arXiv:2506.06606},
year = {2025}
}