中文

$L_2$正则化深度神经网络中的特征学习:吸引/排斥与稀疏性

机器学习 2022-10-17 v2 人工智能 机器学习 神经与进化计算

摘要

我们研究带L2L_{2}正则化的深度神经网络(DNN)的损失曲面。我们表明,关于参数的损失可重新表述为关于训练集的逐层激活ZZ_{\ell}的损失。这一重构揭示了特征学习背后的动力学:每个隐藏表示ZZ_{\ell}相对于一个吸引/排斥问题是最优的,并在输入表示与输出表示之间进行插值,尽可能少地从输入中保留构造下一层激活所必需的信息。对于正齐次非线性函数,该损失可进一步用隐藏表示的协方差重新表述,其形式是在凸锥上的部分凸优化。这第二个重构使我们能够证明齐次DNN的一个稀疏性结果:带L2L_{2}正则化损失的任意局部极小都可由每层至多N(N+1)N(N+1)个神经元实现(其中NN为训练集大小)。我们通过给出一个需要N2/4N^{2}/4个隐藏神经元的局部极小例子说明该界是紧的。但我们在数值上也观察到,在更传统的设定中,达到极小所需的神经元远少于N2N^{2}个。

关键词

引用

@article{arxiv.2205.15809,
  title  = {Feature Learning in $L_{2}$-regularized DNNs: Attraction/Repulsion and Sparsity},
  author = {Arthur Jacot and Eugene Golikov and Clément Hongler and Franck Gabriel},
  journal= {arXiv preprint arXiv:2205.15809},
  year   = {2022}
}