无正则化梯度下降学习的过参数化深度神经网络估计的期望 L_2 误差分析
机器学习
2023-11-27 v1 机器学习
摘要
近期结果表明,通过对正则化经验 L_2 风险应用梯度下降得到的过参数化深度神经网络所定义的估计具有普遍一致性并取得良好收敛速率。在本文中,我们表明为获得类似结果并不需要正则化项。在适当选择网络初始化、适当数量的梯度下降步数以及适当步长的情况下,我们表明无正则化项的估计对有界预测变量是普遍一致的。此外,我们表明若回归函数具有 Hölder 光滑性且 Hölder 指数为 1/2 ≤ p ≤ 1,则 L_2 误差以约 n^{-1/(1+d)} 的收敛速率趋于零。进一步,在交互模型情形下,即回归函数由具有 d^* 个分量的 Hölder 光滑函数之和构成时,推导出一个不依赖于输入维度 d 的收敛速率。
引用
@article{arxiv.2311.14609,
title = {Analysis of the expected $L_2$ error of an over-parametrized deep neural network estimate learned by gradient descent without regularization},
author = {Selina Drews and Michael Kohler},
journal= {arXiv preprint arXiv:2311.14609},
year = {2023}
}