过参数化浅层神经网络优化景观的理论洞察
机器学习
2022-08-25 v3 信息论
math.IT
最优化与控制
机器学习
摘要
在本文中,我们研究学习一个最能拟合训练数据集的浅层人工神经网络的问题。我们在过参数化机制下研究该问题,其中观测数量少于模型中的参数数量。我们表明,对于二次激活函数,训练此类浅层神经网络的优化景观具有某些有利特性,使得能够使用多种局部搜索启发式方法高效找到全局最优模型。该结果适用于任意输入/输出对训练数据。对于可微激活函数,我们还表明,梯度下降在适当初始化时,以线性速率收敛到全局最优模型。该结果聚焦于一个可实现的模型,其中输入从高斯分布中独立同分布地选取,标签根据植入的权重系数生成。
引用
@article{arxiv.1707.04926,
title = {Theoretical insights into the optimization landscape of over-parameterized shallow neural networks},
author = {Mahdi Soltanolkotabi and Adel Javanmard and Jason D. Lee},
journal= {arXiv preprint arXiv:1707.04926},
year = {2022}
}
备注
A mistake in the argument of Proposition 7.1 in the previous version of this manuscript was fixed