非凸机器学习的二阶优化:一项实证研究
最优化与控制
2018-02-19 v2 机器学习
数值分析
机器学习
摘要
虽然随机梯度下降(SGD)等一阶优化方法在机器学习(ML)中很流行,但它们存在众所周知的缺陷,包括收敛相对缓慢、对学习率等超参数设置敏感、在高训练误差处停滞以及难以逃离平坦区域和鞍点。这些问题在神经网络等高度非凸环境中尤为尖锐。受此启发,最近人们对旨在通过捕捉曲率信息来缓解这些缺点的二阶方法产生了兴趣。在本文中,我们报告了一类牛顿型方法(即信任域(TR)和自适应三次正则化(ARC)算法的子采样变体)在非凸 ML 问题上的详细实证评估。在此过程中,我们证明了这些方法不仅在计算上可以与手工调整的动量 SGD 相媲美,获得相当或更好的泛化性能,而且对超参数设置具有高度鲁棒性。此外,与动量 SGD 相比,我们展示了这些牛顿型方法利用曲率信息的方式使它们能够无缝逃离平坦区域和鞍点。
引用
@article{arxiv.1708.07827,
title = {Second-Order Optimization for Non-Convex Machine Learning: An Empirical Study},
author = {Peng Xu and Farbod Roosta-Khorasani and Michael W. Mahoney},
journal= {arXiv preprint arXiv:1708.07827},
year = {2018}
}
备注
21 pages, 11 figures. Restructure the paper and add experiments