神经泰勒近似:修正网络中的收敛与探索
机器学习
2018-06-07 v3 神经与进化计算
机器学习
摘要
现代卷积网络,结合了修正线性单元与最大池化,既非光滑也非凸;因此标准保证不适用。尽管如此,来自凸优化的方法如梯度下降和Adam被广泛用作深度学习算法的构建模块。本文提供了首个适用于现代卷积网络的收敛保证,且该保证与凸非光滑函数的下界匹配。关键技术工具是神经泰勒近似——将泰勒展开直接应用于神经网络——以及相关的泰勒损失。在一系列优化器、层和任务上的实验提供的证据表明,该分析准确捕捉了神经优化的动态。论文后半部分应用泰勒近似来隔离训练修正网络的主要困难——即梯度破碎——并研究如下假设:通过更彻底地探索激活配置空间,诸如RMSProp和Adam之类的自适应优化器能够收敛到更好的解。
引用
@article{arxiv.1611.02345,
title = {Neural Taylor Approximations: Convergence and Exploration in Rectifier Networks},
author = {David Balduzzi and Brian McWilliams and Tony Butler-Yeoman},
journal= {arXiv preprint arXiv:1611.02345},
year = {2018}
}
备注
ICML 2017, final version