基于表达能力的神经网络经验风险最小化泛化性
机器学习
2025-03-07 v1 人工智能
统计理论
统计理论
摘要
学习方法的首要目标是泛化。经典的统一泛化界限依赖 VC 维或 Rademacher 复杂度,无法解释深度学习中过参数化模型 exhibits 良好泛化性这一显著属性。另一方面,算法相关的泛化界限(如稳定性界限)往往依赖严格假设。为在更宽松的假设下建立泛化性,本文考察了最小化或近似最小化经验风险的神经网络的泛化性。在充分大的训练样本和网络规模下,这些网络(包括过参数化网络)能够有效泛化。我们据此建立了基于网络表达能力的种均准确率下界,表明在足够大的样本和网络规模下,这些网络可以实现良好泛化。此外,我们提供了一种必要条件,表明对于某些数据分布,确保泛化所需的训练数据数量超过表示该数据分布所需的网络规模。最后,我们对深度学习中的若干现象提供了理论见解,包括鲁棒泛化、过参数化的重要性以及损失函数对泛化的影响。
引用
@article{arxiv.2503.04111,
title = {Generalizability of Neural Networks Minimizing Empirical Risk Based on Expressive Ability},
author = {Lijia Yu and Yibo Miao and Yifan Zhu and Xiao-Shan Gao and Lijun Zhang},
journal= {arXiv preprint arXiv:2503.04111},
year = {2025}
}