梯度下降在两层宽神经网络均方误差回归中的隐式偏差
机器学习
2023-05-30 v5 机器学习
摘要
我们研究宽神经网络的梯度下降训练及其在函数空间中的相应隐式偏差。对于单变量回归,我们证明,训练一个宽度为 的浅层 ReLU 网络所得到的解,与某个函数的距离在 以内;该函数拟合训练数据,且其与初始函数之差具有最小的二阶导数加权 2-范数,其权重为由初始化网络参数所用概率分布决定的曲率惩罚项。我们针对多种常见初始化过程显式计算了曲率惩罚函数。例如,采用均匀分布的非对称初始化会产生常数曲率惩罚,从而解函数即为训练数据的自然三次样条插值。对于随机梯度下降,我们得到相同的隐式偏差结果。对于不同的激活函数,我们也获得了类似结果。对于多变量回归,我们展示了类似的结果,其中二阶导数被分数阶拉普拉斯算子的 Radon 变换所取代。对于产生常数惩罚函数的初始化方案,其解为多调和样条。此外,我们证明训练轨迹可由正则化强度递减的平滑样条轨迹所刻画。
引用
@article{arxiv.2006.07356,
title = {Implicit Bias of Gradient Descent for Mean Squared Error Regression with Two-Layer Wide Neural Networks},
author = {Hui Jin and Guido Montúfar},
journal= {arXiv preprint arXiv:2006.07356},
year = {2023}
}
备注
97 pages, 14 figures. Added the discussion of SGD and implications to generalization