神经网络如何学习支持:随机梯度下降的隐式正则化效应
机器学习
2024-06-18 v1 最优化与控制
机器学习
摘要
我们研究了深度神经网络识别目标函数支持的能力。我们的发现表明,小批量 SGD 在网络第一层有效地学习了支持,通过将与输入无关组件相关联的权重压缩为零。相比之下,我们证明了虽然原始梯度下降也会逼近目标函数,但需要显式正则化项才能在网络第一层学习支持。我们证明了小批量 SGD 的这一属性是由于与步长/批量大小比例为 的二阶隐式正则化效应所致。我们的结果不仅是另一证明隐式正则化对训练优化动力学具有重要影响的证据,还揭示了网络所学习特征的结构。此外,它们表明更小的批量可以增强特征的可解释性并减少对初始化的依赖。
引用
@article{arxiv.2406.11110,
title = {How Neural Networks Learn the Support is an Implicit Regularization Effect of SGD},
author = {Pierfrancesco Beneventano and Andrea Pinto and Tomaso Poggio},
journal= {arXiv preprint arXiv:2406.11110},
year = {2024}
}
备注
34 pages, 19 figures