中文

多元浅层 ReLU 网络中极小值稳定性的隐式偏置

机器学习 2023-07-03 v1

摘要

我们研究了在使用随机梯度下降训练具有二次损失的单隐藏层多元 ReLU 网络时,其所收敛的解的类型。我们的结果基于动力学稳定性分析。在单变量情形下,已有研究表明线性稳定的极小值对应于网络函数(预测器),其二阶导数的加权 L1L^1 范数有界。值得注意的是,该界随步长增大而变小,意味着使用大步长训练会得到“更平滑”的预测器。在此我们将该结果推广到多元情形,表明类似结论适用于预测器的拉普拉斯算子。我们在 MNIST 数据集上证明了我们所给界的紧性,并表明它准确刻画了作为步长函数的解的行为。此外,我们证明了对应于损失稳定极小值的 ReLU 网络逼近能力上存在深度分离结果。具体而言,尽管浅层 ReLU 网络是通用逼近器,我们证明稳定的浅层网络并非如此。即,存在一个函数无法被以非零步长训练的稳定单隐藏层 ReLU 网络很好地逼近。而同一函数可作为稳定的双隐藏层 ReLU 网络实现。最后,我们证明若函数在 Sobolev 意义下足够光滑,则它可被对应于梯度下降稳定解的浅层 ReLU 网络任意好地逼近。

关键词

引用

@article{arxiv.2306.17499,
  title  = {The Implicit Bias of Minima Stability in Multivariate Shallow ReLU Networks},
  author = {Mor Shpigel Nacson and Rotem Mulayoff and Greg Ongie and Tomer Michaeli and Daniel Soudry},
  journal= {arXiv preprint arXiv:2306.17499},
  year   = {2023}
}

备注

Published at ICLR 2023. Fixed statements and proofs of Proposition 3 and Theorem 2