中文

使用 Logistic 损失训练的宽两层神经网络的梯度下降隐式偏置

最优化与控制 2020-06-23 v4 机器学习 机器学习

摘要

用基于梯度的方法最小化 logistic(又称交叉熵)损失训练的神经网络在许多监督分类任务中表现良好。为理解此现象,我们分析了具有齐次激活函数的无穷宽两层神经网络的训练与泛化行为。我们表明,在指数尾损失上梯度流的极限可完全刻画为某非希尔伯特函数空间中的最大间隔分类器。在存在隐藏低维结构时,所得间隔与 ambient 维数无关,从而导出强泛化界。相比之下,仅训练输出层隐式求解一个核支持向量机,其先验上不享有此种适应性。我们对训练的分析在运行时间上是非定量的,但通过在简化设置中展示与在线镜像下降的等价性给出了计算保证。最后,数值实验表明我们的分析很好地描述了具有 ReLU 激活的两层神经网络的实际行为,并证实了该隐式偏置的统计益处。

关键词

引用

@article{arxiv.2002.04486,
  title  = {Implicit Bias of Gradient Descent for Wide Two-layer Neural Networks Trained with the Logistic Loss},
  author = {Lenaic Chizat and Francis Bach},
  journal= {arXiv preprint arXiv:2002.04486},
  year   = {2020}
}