关于经验风险的局部极小值
机器学习
2018-10-19 v2 最优化与控制
机器学习
摘要
在机器学习中,总体风险始终是首要关注点;然而,学习算法只能访问经验风险。即使对于使用非凸非光滑损失的应用(如现代深度网络),从优化角度来看,总体风险通常也比经验风险显著更良态。具体而言,采样会创建许多虚假局部极小值。我们考虑一个通用框架,旨在仅能访问逐点接近 的近似 (经验风险)(即 )时,优化光滑非凸函数 (总体风险)。我们的目标是找到底层函数 的 -近似局部极小值,同时避免因容差 而产生的浅层局部极小值,这些极小值仅存在于 中。我们提出了一种基于对 的平滑版本进行随机梯度下降(SGD)的简单算法,只要 ,该算法即可保证实现我们的目标。我们还提供了一个几乎匹配的下界,表明在对 进行多项式次数查询的所有算法中,我们的算法实现了最优的误差容限 。作为一个具体示例,我们展示了我们的结果可直接用于给出学习 ReLU 单元的样本复杂度。
引用
@article{arxiv.1803.09357,
title = {On the Local Minima of the Empirical Risk},
author = {Chi Jin and Lydia T. Liu and Rong Ge and Michael I. Jordan},
journal= {arXiv preprint arXiv:1803.09357},
year = {2018}
}
备注
To appear in NIPS 2018