深度神经网络泛化差距的通用平均场上界
无序系统与神经网络
2022-03-03 v2 统计力学
摘要
现代深度神经网络(DNNs)对理论研究者而言是一项艰巨挑战:根据描述其性能的被广泛接受的概率框架,这些架构由于待训练参数数量巨大应当过拟合,但在实践中它们并未过拟合。在此,我们借助副本平均场理论,在教师-学生场景及带二次损失函数的回归问题中,计算具有淬灭特征的机器学习模型的泛化差距。值得注意的是,该框架包含了这样一种 DNN 情形:在给定其余权重特定实现的前提下优化最后一层。我们展示了这些结果——结合统计学习理论中的思想——如何为完全训练好的 DNN 的泛化差距提供关于数据集大小 的严格渐近上界。特别地,在 和 (其中 为最后一层大小)均较大且 的极限下,对于任意架构与教师函数的选择,泛化差距比 更快地趋于零。值得注意的是,该结果极大改进了统计学习理论的现有界限。我们在从具有少量隐藏层的玩具全连接神经网络到最先进的深度卷积神经网络这一广泛架构上检验了我们的预测。
引用
@article{arxiv.2201.11022,
title = {Universal mean field upper bound for the generalisation gap of deep neural networks},
author = {S. Ariosto and R. Pacelli and F. Ginelli and M. Gherardi and P. Rotondo},
journal= {arXiv preprint arXiv:2201.11022},
year = {2022}
}
备注
13 pages, 6 figures