中文

一种避免鞍点的确定性基于梯度的方法

机器学习 2020-09-29 v2 数值分析 动力系统 数值分析 机器学习

摘要

具有大量鞍点的损失函数是高效训练现代机器学习模型的主要障碍之一。一阶方法如梯度下降通常是训练机器学习模型的首选方法。然而,对于某些初始猜测的选择,这些方法会收敛到鞍点。本文中,我们提出对最近提出的拉普拉斯平滑梯度下降 [Osher 等, arXiv:1806.06317] 的改进,称为改进拉普拉斯平滑梯度下降(mLSGD),并展示其在不牺牲收敛速率的情况下避免鞍点的潜力。我们的分析基于吸引域,即所有使所考虑的数值格式收敛到鞍点的起始点构成的集合。我们从解析和数值两方面研究吸引域的维数。对于一类典型的二次函数,我们证明 mLSGD 的吸引域维数为 floor((n-1)/2),因此显著小于梯度下降的维数 n-1。

关键词

引用

@article{arxiv.1901.06827,
  title  = {A Deterministic Gradient-Based Approach to Avoid Saddle Points},
  author = {Lisa Maria Kreusser and Stanley J. Osher and Bao Wang},
  journal= {arXiv preprint arXiv:1901.06827},
  year   = {2020}
}