中文

神经网络 Dropout 算法的几乎必然收敛性

最优化与控制 2023-03-24 v2 机器学习 概率论

摘要

我们研究了受 Dropout (Hinton et al., 2012) 启发的神经网络 (NNs) 随机训练算法的收敛性与收敛速率。为了避免 NNs 训练过程中的过拟合,dropout 算法在实践中由以下方式构成:在随机梯度下降 (SGD) 的每次迭代中,将 NN 的权重矩阵按元素乘以独立抽取的、取值为 {0,1}\{0, 1 \} 的随机矩阵。本文从概率论角度证明,对于具有可微、多项式有界激活函数的全连接 NNs,若在使用 dropout 算法时将权重投影到紧集上,则 NN 的权重收敛到投影常微分方程 (ODEs) 系统的唯一驻点。在给出这一一般性收敛保证后,我们进一步研究 dropout 的收敛速率。首先,我们得到了使用带 dropout 的 SGD 寻找光滑非凸函数的 ϵ\epsilon-驻点的通用样本复杂度界,其显式依赖于 dropout 概率。其次,我们得到了对于具有任意深度树形结构形状且带线性激活函数的 NNs,其 dropout 算法极限 ODEs 上梯度下降 (GD) 收敛速率的上界。后一界表明,对于如 Dropout 或 Dropconnect (Wan et al., 2013) 这样的算法,收敛速率可能因树形结构的深度而呈指数级恶化。相比之下,我们在实验上观察到,对于仅含少数 dropout 层的宽 NNs,不存在此种依赖关系。我们也对这一观察给出了启发式解释。我们的结果表明,在收敛速率中 dropout 概率的影响存在尺度变化,该变化取决于 NN 宽度相对于深度的相对大小。

关键词

引用

@article{arxiv.2002.02247,
  title  = {Almost Sure Convergence of Dropout Algorithms for Neural Networks},
  author = {Albert Senen-Cerda and Jaron Sanders},
  journal= {arXiv preprint arXiv:2002.02247},
  year   = {2023}
}

备注

52 pages, 3 figures. Added results pertaining to the convergence rate of Dropout SGD to $\epsilon$-stationary points and numerical experiments. Updated the introduction, conclusion and appendix. Changed format to one-column text