中文

恒定大学习率的 SGD 可收敛至局部极大值

机器学习 2023-05-30 v4 最优化与控制 机器学习

摘要

以往关于随机梯度下降(SGD)的研究常聚焦于其成功之处。本文构造了最坏情况下的优化问题,以说明当不处于以往研究通常假设的机制时,SGD 可能表现出许多奇怪且潜在不良的行为。具体而言,我们构造了损失景观与数据分布,使得 (1) SGD 收敛至局部极大值,(2) SGD 以任意缓慢的速度逃离鞍点,(3) SGD 偏好尖锐极小值而非平坦极小值,以及 (4) AMSGrad 收敛至局部极大值。我们还在一个极简的类神经网络示例中实现了这些结果。我们的结果凸显了同时分析小批量采样、离散时间更新规则以及真实景观对于理解 SGD 在深度学习中作用的重要性。

关键词

引用

@article{arxiv.2107.11774,
  title  = {SGD with a Constant Large Learning Rate Can Converge to Local Maxima},
  author = {Liu Ziyin and Botao Li and James B. Simon and Masahito Ueda},
  journal= {arXiv preprint arXiv:2107.11774},
  year   = {2023}
}

备注

Fixed typos