具有 ReLU 激活函数的神经网络参数化退化程度如何?
机器学习
2023-02-10 v3 泛函分析
最优化与控制
机器学习
摘要
神经网络训练通常通过随机梯度下降求解非凸优化问题来完成。尽管优化的是网络参数,主损失函数一般仅依赖于神经网络的实现,即其计算的函数。在研究实现空间上的优化问题为理解神经网络训练开辟了新途径。特别地,常用损失函数如均方误差和分类交叉熵在实现空间上是凸的,而实现空间本身是非凸的。神经网络的逼近能力可用于处理后一种非凸性,这使我们能够确立:对于足够大的网络,实现空间上正则化优化问题的局部极小几乎是最优的。但需注意,每个实现都有许多不同、可能退化的参数化。尤其,参数化空间中的局部极小未必对应于实现空间中的局部极小。为建立此类联系,需要实现映射的逆稳定性,即实现的接近必须蕴含对应参数化的接近。我们给出了阻碍一般逆稳定性的病态现象,并针对浅层网络,进一步建立了一个受限参数化空间,在其上我们具有相对于 Sobolev 范数的逆稳定性。此外,我们表明通过在此受限集上优化,仍有可能学到任何可通过在无限制集上优化所学到的函数。
引用
@article{arxiv.1905.09803,
title = {How degenerate is the parametrization of neural networks with the ReLU activation function?},
author = {Julius Berner and Dennis Elbrächter and Philipp Grohs},
journal= {arXiv preprint arXiv:1905.09803},
year = {2023}
}
备注
Accepted at NeurIPS 2019