中文

面向过参数化深度 ReLU 网络的体系结构无关泛化界限

机器学习 2026-01-27 v5 人工智能 偏微分方程分析 最优化与控制 机器学习

摘要

我们证明了过参数化神经网络能够以测试误差实现泛化,该误差独立于过参数化水平,也独立于 Vapnik-Chervonenkis (VC) 维数。我们证明了显式的界限仅取决于测试集和训练集的度量几何、激活函数的正则化属性以及权重的算子范数和偏置项的范数。对于训练样本数受限于输入空间维度的过参数化深层 ReLU 网络,我们显式构造零损失最小化解,无需使用梯度下降,并证明该泛化界限独立于网络体系结构。我们对 MNIST 数据集上的计算实验表明,理论结果与真实测试误差在平均误差范围内为 22%。

关键词

引用

@article{arxiv.2504.05695,
  title  = {Architecture independent generalization bounds for overparametrized deep ReLU networks},
  author = {Anandatheertha Bapu and Thomas Chen and Chun-Kai Kevin Chien and Patricia Muñoz Ewald and Andrew G. Moore},
  journal= {arXiv preprint arXiv:2504.05695},
  year   = {2026}
}

备注

AMS Latex, 19 pages