中文

关于经验风险的局部极小值

机器学习 2018-10-19 v2 最优化与控制 机器学习

摘要

在机器学习中,总体风险始终是首要关注点;然而,学习算法只能访问经验风险。即使对于使用非凸非光滑损失的应用(如现代深度网络),从优化角度来看,总体风险通常也比经验风险显著更良态。具体而言,采样会创建许多虚假局部极小值。我们考虑一个通用框架,旨在仅能访问逐点接近 FF 的近似 ff(经验风险)(即 Ffν\|F-f\|_{\infty} \le \nu)时,优化光滑非凸函数 FF(总体风险)。我们的目标是找到底层函数 FFϵ\epsilon-近似局部极小值,同时避免因容差 ν\nu 而产生的浅层局部极小值,这些极小值仅存在于 ff 中。我们提出了一种基于对 ff 的平滑版本进行随机梯度下降(SGD)的简单算法,只要 νO(ϵ1.5/d)\nu \le O(\epsilon^{1.5}/d),该算法即可保证实现我们的目标。我们还提供了一个几乎匹配的下界,表明在对 ff 进行多项式次数查询的所有算法中,我们的算法实现了最优的误差容限 ν\nu。作为一个具体示例,我们展示了我们的结果可直接用于给出学习 ReLU 单元的样本复杂度。

关键词

引用

@article{arxiv.1803.09357,
  title  = {On the Local Minima of the Empirical Risk},
  author = {Chi Jin and Lydia T. Liu and Rong Ge and Michael I. Jordan},
  journal= {arXiv preprint arXiv:1803.09357},
  year   = {2018}
}

备注

To appear in NIPS 2018