窄一隐藏层网络在教师-学生设置下的泛化性能
无序系统与神经网络
2026-03-26 v4 机器学习
概率论
统计理论
统计理论
摘要
理解神经网络在简单输入输出分布上的泛化属性,是解释其在真实数据集上的性能的关键。经典的教师-学生设置,即网络在由教师模型生成的数据上进行训练,提供了一种标准的理论测试场。然而,对具有通用激活函数的全连接一隐藏层网络的完整理论表征仍然缺失。在本工作中,我们发展了一种用于此类网络的通用框架,网络宽度较大,但仍远小于输入维度。通过统计物理方法,我们推导了有限温度(贝叶斯)和经验风险最小化估计器的典型性能表达式,这些表达式仅用少数几个序参数即可表示。我们发现,随着样本数变得足够大并与网络参数数目成正比,隐藏神经元会与教师特征对齐,从而出现一种专化相变。我们的理论准确预测了使用 noisy full-batch 梯度下降(Langevin 动力学)或确定性 full-batch 梯度下降在回归和分类任务中训练的网络的泛化误差。
引用
@article{arxiv.2507.00629,
title = {Generalization performance of narrow one-hidden layer networks in the teacher-student setting},
author = {Rodrigo Pérez Ortiz and Gibbs Nwemadji and Jean Barbier and Federica Gerace and Alessandro Ingrosso and Clarissa Lauditi and Enrico M. Malatesta},
journal= {arXiv preprint arXiv:2507.00629},
year = {2026}
}
备注
37 pages, 7 figures