ReLU激活如何影响高维神经网络回归上的梯度下降隐式偏差?
机器学习
2026-03-06 v1 机器学习
最优化与控制
摘要
超参数ML模型,包括神经网络,通常诱导训练目标欠确定性,具有多个全局最小值。隐式偏差指的是由常见优化算法(如梯度下降GD)获得的 limiting 全局最小值。在本文中,我们对用于高维随机特征的浅层ReLU模型进行平方损失训练的GD隐式偏差进行表征。先前工作表明,在最坏情况下(Vardi和Shamir, 2021)不存在隐式偏差,或在数据恰好正交时对应恰好所有全局最小值中的 minimum-l2范数解(Boursier等, 2022)。我们的工作在这两个极端之间起作用,表明对于充分高维随机数据,隐式偏差以高概率近似于 minimum-l2范数解,间隙为,其中n为训练样本数,d为特征维度。我们通过一种新颖的原始-对偶分析获得这些结果,这种分析仔细跟踪预测、数据跨度系数以及它们的相互作用的演化,并表明ReLU激活模式在高概率下随随机数据的快速稳定。
引用
@article{arxiv.2603.04895,
title = {How Does the ReLU Activation Affect the Implicit Bias of Gradient Descent on High-dimensional Neural Network Regression?},
author = {Kuo-Wei Lai and Guanghui Wang and Molei Tao and Vidya Muthukumar},
journal= {arXiv preprint arXiv:2603.04895},
year = {2026}
}
备注
62 pages