中文

通过梯度下降训练的浅层过参数化ReLU神经网络学习Lipschitz函数

机器学习 2023-04-07 v2 机器学习

摘要

我们探讨了过参数化浅层ReLU神经网络在通过梯度下降(GD)训练时,学习带加性噪声的Lipschitz、不可微、有界函数的能力。为避免在噪声存在下,训练至近零训练误差的神经网络在该函数类中不一致的问题,我们关注早停GD,这使我们能够证明其一致性与最优收敛速率。特别地,我们从GD训练的有限宽神经网络的神经正切核(NTK)近似视角考察此问题。我们证明:只要某个早停规则能保证在由ReLU激活函数诱导的核的Hilbert空间上给出最优的(超额风险)速率,同一规则便可用于神经网络在所给Lipschitz函数类上实现极小极大最优速率。我们讨论了几种实用且数据无关与数据依赖的早停规则,它们均能给出最优速率。

关键词

引用

@article{arxiv.2212.13848,
  title  = {Learning Lipschitz Functions by GD-trained Shallow Overparameterized ReLU Neural Networks},
  author = {Ilja Kuzborskij and Csaba Szepesvári},
  journal= {arXiv preprint arXiv:2212.13848},
  year   = {2023}
}