中文

具有随机掩蔽神经元的浅层神经网络训练的收敛性

机器学习 2022-08-15 v2

摘要

出于训练神经网络全部参数的动机,我们研究何时以及为何可通过迭代地创建、训练并组合随机选择的子网络来实现这一点。此类情形已隐含或显式地出现于近期文献中:例如 Dropout 系列正则化技术,或某些降低通信/计算复杂度的分布式 ML 训练协议,如独立子网络训练(Independent Subnet Training)协议。尽管这些方法已在经验上被研究并用于实践,它们通常缺乏或部分缺乏理论支撑,尤其在基于神经网络的目标上应用时。本文中,我们关注惰性训练机制下具有 ReLU 激活的过参数化单隐藏层神经网络。通过仔细分析 i)i) 子网络的神经正切核,ii)ii) 替代函数的梯度,以及 iii)iii) 我们如何采样并组合替代函数,我们证明了对于具有回归损失的过参数化单隐藏层感知机,训练误差在最优解邻域内具有线性收敛速率。我们的分析揭示了最优解邻域大小对替代模型数量及每个所选子网络局部训练步数的依赖关系。此外,所考虑的框架推广并为 dropout 训练、多样本 dropout 训练以及独立子网络训练提供了新见解;对每种情况,我们给出作为主定理推论的收敛结果。

关键词

引用

@article{arxiv.2112.02668,
  title  = {On the Convergence of Shallow Neural Network Training with Randomly Masked Neurons},
  author = {Fangshuo Liao and Anastasios Kyrillidis},
  journal= {arXiv preprint arXiv:2112.02668},
  year   = {2022}
}