中文

神经泰勒近似:修正网络中的收敛与探索

机器学习 2018-06-07 v3 神经与进化计算 机器学习

摘要

现代卷积网络,结合了修正线性单元与最大池化,既非光滑也非凸;因此标准保证不适用。尽管如此,来自凸优化的方法如梯度下降和Adam被广泛用作深度学习算法的构建模块。本文提供了首个适用于现代卷积网络的收敛保证,且该保证与凸非光滑函数的下界匹配。关键技术工具是神经泰勒近似——将泰勒展开直接应用于神经网络——以及相关的泰勒损失。在一系列优化器、层和任务上的实验提供的证据表明,该分析准确捕捉了神经优化的动态。论文后半部分应用泰勒近似来隔离训练修正网络的主要困难——即梯度破碎——并研究如下假设:通过更彻底地探索激活配置空间,诸如RMSProp和Adam之类的自适应优化器能够收敛到更好的解。

关键词

引用

@article{arxiv.1611.02345,
  title  = {Neural Taylor Approximations: Convergence and Exploration in Rectifier Networks},
  author = {David Balduzzi and Brian McWilliams and Tony Butler-Yeoman},
  journal= {arXiv preprint arXiv:1611.02345},
  year   = {2018}
}

备注

ICML 2017, final version