$L_2$正则化深度神经网络中的特征学习:吸引/排斥与稀疏性
机器学习
2022-10-17 v2 人工智能
机器学习
神经与进化计算
摘要
我们研究带正则化的深度神经网络(DNN)的损失曲面。我们表明,关于参数的损失可重新表述为关于训练集的逐层激活的损失。这一重构揭示了特征学习背后的动力学:每个隐藏表示相对于一个吸引/排斥问题是最优的,并在输入表示与输出表示之间进行插值,尽可能少地从输入中保留构造下一层激活所必需的信息。对于正齐次非线性函数,该损失可进一步用隐藏表示的协方差重新表述,其形式是在凸锥上的部分凸优化。这第二个重构使我们能够证明齐次DNN的一个稀疏性结果:带正则化损失的任意局部极小都可由每层至多个神经元实现(其中为训练集大小)。我们通过给出一个需要个隐藏神经元的局部极小例子说明该界是紧的。但我们在数值上也观察到,在更传统的设定中,达到极小所需的神经元远少于个。
引用
@article{arxiv.2205.15809,
title = {Feature Learning in $L_{2}$-regularized DNNs: Attraction/Repulsion and Sparsity},
author = {Arthur Jacot and Eugene Golikov and Clément Hongler and Franck Gabriel},
journal= {arXiv preprint arXiv:2205.15809},
year = {2022}
}