中文

一种用于非均匀光滑非凸优化的随机拟牛顿法

机器学习 2024-09-27 v2 最优化与控制

摘要

优化算法的经典收敛分析依赖于广泛采用的一致光滑性假设。然而,近期的实验研究表明,许多机器学习问题表现出非均匀光滑性,即光滑因子是模型参数的函数而非一个通用常数。特别地,已观察到光滑性沿训练轨迹随梯度范数增长。受此现象启发,最近引入的(L0,L1)(L_0, L_1)-光滑性是一个比传统LL-光滑性更一般的概念,它捕捉了光滑性与梯度范数之间的这种正相关关系。在这种非均匀光滑性条件下,现有文献已通过利用梯度裁剪技术设计了随机一阶算法,以获得寻找ϵ\epsilon-近似一阶驻点所需的O(ϵ3)\mathcal{O}(\epsilon^{-3})最优样本复杂度。然而,对拟牛顿法的研究仍然缺乏。考虑到拟牛顿法具有更高的精度和更强的鲁棒性,本文在光滑性存在非均匀性时提出了一种快速的随机拟牛顿法。通过利用梯度裁剪和方差缩减,我们的算法能够达到已知最佳的O(ϵ3)\mathcal{O}(\epsilon^{-3})样本复杂度,并通过简单的超参数调整实现收敛加速。我们的数值实验表明,所提出的算法优于当前最先进的方法。

关键词

引用

@article{arxiv.2403.15244,
  title  = {A Stochastic Quasi-Newton Method for Non-convex Optimization with Non-uniform Smoothness},
  author = {Zhenyu Sun and Ermin Wei},
  journal= {arXiv preprint arXiv:2403.15244},
  year   = {2024}
}

备注

Paper accepted by CDC 2024