困在何处?权重空间中的探索
机器学习
2016-02-25 v1
摘要
深度学习研究者通常认为收敛模型困在局部极小。最近一些研究者在合理假设下观察到绝大多数临界点是鞍点而非真正极小。两种描述都暗示权重收敛于权重空间中的某点附近,无论是局部最优点还是仅是临界点。然而,两种解释可能都不准确。由于神经网络通常过完备,容易展示权重空间中具有相等损失的广阔连续区域的存在。本文基于近期经验刻画神经网络误差曲面的工作。我们分析权重空间中的训练路径,提出证据表明损失的表观收敛并不对应于权重到达临界点,而是对应于穿过权重空间平坦区域的大幅移动。尽管展示神经网络误差曲面全局非凸是平凡的,我们展示误差曲面也是局部非凸的,即使在随机初始化打破对称性后以及部分训练后亦然。
引用
@article{arxiv.1602.07320,
title = {Stuck in a What? Adventures in Weight Space},
author = {Zachary C. Lipton},
journal= {arXiv preprint arXiv:1602.07320},
year = {2016}
}