一种用于非均匀光滑非凸优化的随机拟牛顿法
机器学习
2024-09-27 v2 最优化与控制
摘要
优化算法的经典收敛分析依赖于广泛采用的一致光滑性假设。然而,近期的实验研究表明,许多机器学习问题表现出非均匀光滑性,即光滑因子是模型参数的函数而非一个通用常数。特别地,已观察到光滑性沿训练轨迹随梯度范数增长。受此现象启发,最近引入的-光滑性是一个比传统-光滑性更一般的概念,它捕捉了光滑性与梯度范数之间的这种正相关关系。在这种非均匀光滑性条件下,现有文献已通过利用梯度裁剪技术设计了随机一阶算法,以获得寻找-近似一阶驻点所需的最优样本复杂度。然而,对拟牛顿法的研究仍然缺乏。考虑到拟牛顿法具有更高的精度和更强的鲁棒性,本文在光滑性存在非均匀性时提出了一种快速的随机拟牛顿法。通过利用梯度裁剪和方差缩减,我们的算法能够达到已知最佳的样本复杂度,并通过简单的超参数调整实现收敛加速。我们的数值实验表明,所提出的算法优于当前最先进的方法。
引用
@article{arxiv.2403.15244,
title = {A Stochastic Quasi-Newton Method for Non-convex Optimization with Non-uniform Smoothness},
author = {Zhenyu Sun and Ermin Wei},
journal= {arXiv preprint arXiv:2403.15244},
year = {2024}
}
备注
Paper accepted by CDC 2024