高维数据训练的带泄漏ReLU网络中的隐式偏置
机器学习
2022-10-14 v1 机器学习
摘要
基于梯度的优化算法的隐式偏置被认为是现代深度学习成功的主要因素。在这项工作中,我们研究了当训练数据近乎正交(高维数据的常见性质)时,两层全连接神经网络在带泄漏ReLU激活下梯度流与梯度下降的隐式偏置。对于梯度流,我们利用近期关于齐次神经网络隐式偏置的工作表明,渐近地,梯度流产生的神经网络秩至多为2。此外,该网络是一个 最大间隔解(在参数空间中),并且具有对应于近似最大间隔线性预测器的线性决策边界。对于梯度下降,在随机初始化方差足够小的前提下,我们表明单步梯度下降足以大幅降低网络的秩,且秩在整个训练过程中保持很小。我们提供了实验,表明小的初始化尺度对于用梯度下降找到低秩神经网络十分重要。
引用
@article{arxiv.2210.07082,
title = {Implicit Bias in Leaky ReLU Networks Trained on High-Dimensional Data},
author = {Spencer Frei and Gal Vardi and Peter L. Bartlett and Nathan Srebro and Wei Hu},
journal= {arXiv preprint arXiv:2210.07082},
year = {2022}
}
备注
54 pages