单神经元 ReLU 网络的支撑向量与梯度动力学
机器学习
2022-06-14 v2 人工智能
机器学习
摘要
理解 ReLU 网络泛化能力的梯度下降隐式偏置是机器学习研究中的重要课题。遗憾的是,即使对于使用平方损失训练的单 ReLU 神经元,近期研究表明不可能用模型参数范数来刻画隐式正则化(Vardi & Shamir, 2021)。为缩小理解 ReLU 网络引人注目的泛化行为之间的差距,我们在此考察训练单神经元 ReLU 网络时参数空间中的梯度流动力学。具体而言,我们发现了以支撑向量形式的隐式偏置,它在 ReLU 网络为何及如何良好泛化中起着关键作用。此外,我们分析了关于初始化范数大小的梯度流,并表明所学权重的范数通过梯度流严格递增。最后,我们证明了单 ReLU 神经元在 情形下的全局收敛性。
引用
@article{arxiv.2202.05510,
title = {Support Vectors and Gradient Dynamics of Single-Neuron ReLU Networks},
author = {Sangmin Lee and Byeongsu Sim and Jong Chul Ye},
journal= {arXiv preprint arXiv:2202.05510},
year = {2022}
}