关于梯度下降即使在 R^2 中也是最坏情况低效的注记
机器学习
2022-08-17 v2 机器学习
摘要
梯度下降是优化中一种流行的算法,其在凸设定下的性能大多已被充分理解。在非凸设定下,已证明梯度下降能够渐近地逃离鞍点并收敛到局部极小点 [Lee et. al. 2016]。近期研究还表明,梯度下降的扰动版本足以高效地逃离鞍点 [Jin et. al. 2015, Ge et. al. 2017]。在本文中我们展示了一个负面结果:梯度下降可能需要指数时间逃离鞍点,即便在无非病理性的二维函数中。虽然我们的重点是理论性的,我们也进行了验证理论结果的实验。通过我们的分析,我们证明了随机性对于高效逃离鞍点是必不可少的。
引用
@article{arxiv.2008.07513,
title = {Notes on Worst-case Inefficiency of Gradient Descent Even in R^2},
author = {Shiliang Zuo},
journal= {arXiv preprint arXiv:2008.07513},
year = {2022}
}
备注
Technical report of course research project