中文

利用一阶非凸优化中的非均匀性

机器学习 2022-06-03 v3

摘要

一阶方法的经典全局收敛结果依赖于均匀光滑性与Łojasiewicz不等式。受机器学习中目标函数性质的启发,我们提出了这些概念的非均匀细化,导出了非均匀光滑性(NS)与非均匀Łojasiewicz不等式(NŁ)。新定义启发了几何感知的一阶方法,其能够比经典的 Ω(1/t2)\Omega(1/t^2) 下界更快地收敛到全局最优。为说明这些几何感知方法及其相应非均匀分析的能力,我们考虑机器学习中两个重要问题:强化学习中的策略梯度优化(PG)与监督学习中的广义线性模型训练(GLM)。对于PG,我们发现对梯度上升方法进行归一化可将收敛加速至 O(et)O(e^{-t}),同时比现有算法开销更小。对于GLM,我们证明几何感知的归一化梯度下降也能实现线性收敛率,显著改进了已知最佳结果。我们还额外表明,所提几何感知下降方法比标准梯度下降更快地逃离景观平台。实验结果用于说明并补充理论发现。

关键词

引用

@article{arxiv.2105.06072,
  title  = {Leveraging Non-uniformity in First-order Non-convex Optimization},
  author = {Jincheng Mei and Yue Gao and Bo Dai and Csaba Szepesvari and Dale Schuurmans},
  journal= {arXiv preprint arXiv:2105.06072},
  year   = {2022}
}

备注

48 pages, 10 figures. Accepted at ICML 2021