中文

插值类条件下更快逃离鞍点

机器学习 2020-09-29 v1 机器学习 最优化与控制 统计理论 统计理论

摘要

在本文中,我们表明,在过参数化条件下,若干标准随机优化算法能更快地逃离鞍点并收敛到局部极小点。过参数化模型的一个基本方面是它们能够插值训练数据。我们证明,在过参数化设定中由随机梯度满足的插值类假设下,扰动随机梯度下降(PSGD)算法达到 ϵ\epsilon-局部极小点的一阶预言复杂度和相应的确定性速率 O~(1/ϵ2)\tilde{\mathcal{O}}(1/\epsilon^{2}) 相匹配。接下来我们在插值类条件下分析随机立方正则化牛顿(SCRN)算法,并表明在插值类条件下达到 ϵ\epsilon-局部极小点的预言复杂度为 O~(1/ϵ2.5)\tilde{\mathcal{O}}(1/\epsilon^{2.5})。尽管该复杂度优于无插值类假设时 PSGD 或 SCRN 的对应复杂度,但它与确定性立方正则化牛顿方法对应的 O~(1/ϵ1.5)\tilde{\mathcal{O}}(1/\epsilon^{1.5}) 速率并不匹配。似乎需要进一步的基于 Hessian 的插值类假设来弥合这一差距。我们还讨论了零阶设定下相应的改进复杂度。

关键词

引用

@article{arxiv.2009.13016,
  title  = {Escaping Saddle-Points Faster under Interpolation-like Conditions},
  author = {Abhishek Roy and Krishnakumar Balasubramanian and Saeed Ghadimi and Prasant Mohapatra},
  journal= {arXiv preprint arXiv:2009.13016},
  year   = {2020}
}

备注

To appear in NeurIPS, 2020