深度网络损失曲面优化的实证分析
机器学习
2017-12-11 v4
摘要
深度神经网络的成功取决于我们准确且高效地优化高维非凸函数的能力。本文对最先进网络的损失函数以及常用的随机梯度下降变体如何优化这些损失函数进行了实证研究。为此,我们通过将损失函数投影到基于不同优化算法收敛点选择的低维空间来对其进行可视化。我们的观察表明,优化算法在许多鞍点处遇到并选择不同的下降方向,从而找到不同的最终权重。基于我们在同一种随机优化算法多次运行中观察到的一致性,我们假设每种优化算法在这些鞍点处都会做出具有特征性的选择。
引用
@article{arxiv.1612.04010,
title = {An empirical analysis of the optimization of deep network loss surfaces},
author = {Daniel Jiwoong Im and Michael Tao and Kristin Branson},
journal= {arXiv preprint arXiv:1612.04010},
year = {2017}
}