深度ReLU神经网络中的几何诱导正则化
人工智能
2026-01-06 v2 机器学习
神经与进化计算
最优化与控制
统计理论
统计理论
摘要
具有大量参数的神经网络通常不会过拟合,这归因于有利于“好”网络的隐式正则化。其他相关且令人费解的现象包括平坦最小值、鞍点到鞍点动力学和神经元对齐的性质。为了研究这些现象,我们研究了深度ReLU神经网络的局部几何。我们证明,对于固定架构,随着权重的变化,样本的图像形成一个集合,其局部维度发生变化。参数空间被划分为局部维度保持恒定的区域。局部维度在ReLU网络的自然对称性(即正缩放和神经元排列)下保持不变。然后我们确定网络的几何诱导了正则化,局部维度作为正则性的关键度量。此外,我们将局部维度与最小值平坦性的新概念和鞍点到鞍点动力学联系起来。对于浅层网络,我们还表明局部维度与感知的线性区域数量相关,从而提供了对正则化效果的见解。实验进一步支持了这一点,并与神经元对齐相关联。我们的分析首次为这些通常被孤立研究的现象提供了一个简单且统一的几何解释,适用于所有学习情境。最后,我们探讨了局部维度的实际计算,并在MNIST数据集上进行了实验,突出了该设置中的几何诱导正则化。
引用
@article{arxiv.2402.08269,
title = {Geometry-induced Regularization in Deep ReLU Neural Networks},
author = {Joachim Bona-Pellissier and François Malgouyres and François Bachoc},
journal= {arXiv preprint arXiv:2402.08269},
year = {2026}
}