人工神经网络的分段凸性
机器学习
2016-12-30 v2 人工智能
计算机视觉与模式识别
摘要
尽管人工神经网络在包括计算机视觉和语音识别在内的应用中展现出了巨大潜力,但其参数优化仍存在相当大的实际和理论困难。梯度下降方法在最小化这些非凸函数时看似不合理的成功,至今仍缺乏充分理解。在本工作中,我们为采用分段仿射激活函数的网络提供了一些理论保证,这类激活函数近年来已成为标准。我们证明了三个主要结果。首先,作为输入数据的函数,网络是分段凸的。其次,在保持其他层不变的情况下,将网络视为单层参数的函数,它同样是分段凸的。最后,作为其所有参数的函数,网络是分段多重凸的,这是双凸性的一种推广。在此基础上,我们刻画了训练目标的局部极小值和驻点,表明它们最小化了参数空间的特定子集。随后,我们分析了两种优化算法在多重凸问题上的性能:梯度下降法,以及一种反复求解多个凸子问题的方法。在为目标函数引入正则化之后,我们证明了第一种算法的必要收敛条件,以及第二种算法的必要和充分条件。最后,我们探讨了全局优化问题遗留的困难。在平方误差目标下,我们表明通过改变训练数据,单个整流神经元会存在在目标值和参数空间上任意相距甚远的局部极小值。
引用
@article{arxiv.1607.04917,
title = {Piecewise convexity of artificial neural networks},
author = {Blaine Rister and Daniel L Rubin},
journal= {arXiv preprint arXiv:1607.04917},
year = {2016}
}