面向过参数化深度 ReLU 网络的体系结构无关泛化界限
机器学习
2026-01-27 v5 人工智能
偏微分方程分析
最优化与控制
机器学习
摘要
我们证明了过参数化神经网络能够以测试误差实现泛化,该误差独立于过参数化水平,也独立于 Vapnik-Chervonenkis (VC) 维数。我们证明了显式的界限仅取决于测试集和训练集的度量几何、激活函数的正则化属性以及权重的算子范数和偏置项的范数。对于训练样本数受限于输入空间维度的过参数化深层 ReLU 网络,我们显式构造零损失最小化解,无需使用梯度下降,并证明该泛化界限独立于网络体系结构。我们对 MNIST 数据集上的计算实验表明,理论结果与真实测试误差在平均误差范围内为 22%。
关键词
引用
@article{arxiv.2504.05695,
title = {Architecture independent generalization bounds for overparametrized deep ReLU networks},
author = {Anandatheertha Bapu and Thomas Chen and Chun-Kai Kevin Chien and Patricia Muñoz Ewald and Andrew G. Moore},
journal= {arXiv preprint arXiv:2504.05695},
year = {2026}
}
备注
AMS Latex, 19 pages