中文

浅层神经网络的次二次过参数化

机器学习 2021-11-04 v1 机器学习

摘要

过参数化是指选择神经网络的宽度,使得学习算法在非凸训练中能够被证明达到零损失的重要现象。现有理论利用各种初始化策略、训练修改和宽度缩放来建立这种全局收敛性。特别是,在实践中最优泛化性能的标准初始化策略下,最先进的结果要求宽度与训练数据数量成二次方缩放。相比之下,最新的结果要么通过要求导致“惰性训练”的初始化,要么仅训练单层网络,从而获得线性缩放。在这项工作中,我们提供了一个分析框架,允许我们在基本的浅层神经网络中采用标准初始化策略,可能避免惰性训练,并同时训练所有层,同时实现网络宽度上理想的次二次缩放。我们通过Polyak-Lojasiewicz条件、平滑性以及对数据的标准假设实现了这些目标,并使用了随机矩阵理论的工具。

关键词

引用

@article{arxiv.2111.01875,
  title  = {Subquadratic Overparameterization for Shallow Neural Networks},
  author = {Chaehwan Song and Ali Ramezani-Kebrya and Thomas Pethick and Armin Eftekhari and Volkan Cevher},
  journal= {arXiv preprint arXiv:2111.01875},
  year   = {2021}
}

备注

To appear at the conference on Neural Information Processing Systems (NeurIPS 2021)