论过参数化对高维浅层神经网络训练的影响
最优化与控制
2023-11-08 v1 无序系统与神经网络
机器学习
摘要
我们在教师-学生设定下研究具有二次激活函数与二次代价的浅层神经网络的训练动态。与先前针对同一神经架构的工作一致,优化遵循在群体风险上的梯度流,其中数据点的平均被替换为对其分布的期望(假设为高斯分布)。我们首先推导梯度流的收敛性质,并量化实现强信号恢复所必需的过参数化。然后,假设教师与学生在初始化时构成独立正交归一族,我们推导流的高维极限,并证明最小过参数化足以实现强恢复。我们通过数值实验验证了这些结果对更一般初始化也成立。
引用
@article{arxiv.2311.03794,
title = {On the Impact of Overparameterization on the Training of a Shallow Neural Network in High Dimensions},
author = {Simon Martin and Francis Bach and Giulio Biroli},
journal= {arXiv preprint arXiv:2311.03794},
year = {2023}
}