双层神经网络的非渐近理论:超越偏差-方差权衡
机器学习
2023-08-01 v2 统计理论
机器学习
统计理论
摘要
大型神经网络在现代深度学习实践中已被证明极为有效,即便在活跃参数数量相对样本量很大的过参数化 regime 下亦是如此。这与机器学习模型必须为最优泛化权衡偏差与方差的经典观点相矛盾。为解决此冲突,我们提出一种带 ReLU 激活函数的双层神经网络的非渐近泛化理论,通过引入缩放变分正则化。有趣的是,从基于梯度的优化角度看,该正则化等价于岭回归,但在控制模型复杂度上起类似于群 lasso 的作用。利用这一“岭-套索对偶性”,我们得到了适用于所有网络宽度的新预测界,其重现了双下降现象。此外,当信号较强时,过参数化最小风险低于其欠参数化对应值,并且在适当函数类上近乎极小极大最优。相比之下,我们证明过参数化随机特征模型受维数灾难影响,从而是次优的。
引用
@article{arxiv.2106.04795,
title = {Nonasymptotic theory for two-layer neural networks: Beyond the bias-variance trade-off},
author = {Huiyuan Wang and Wei Lin},
journal= {arXiv preprint arXiv:2106.04795},
year = {2023}
}
备注
47 pages, 1 figure