中文

深度学习中的方向收敛与对齐

机器学习 2020-10-27 v2 神经与进化计算 最优化与控制 机器学习

摘要

在本文中,我们表明尽管交叉熵及相关分类损失的最小化子在无穷远处,但由梯度流学习的网络权重在方向上收敛,并立即得到推论:网络预测、训练误差和间隔分布也收敛。该证明对深度齐次网络成立——这是一类允许 ReLU、最大池化、线性和卷积层的广泛网络——并且我们额外提供了经验支持,不仅接近于理论(例如 AlexNet),也在非齐次网络(例如 DenseNet)上成立。如果网络进一步具有局部 Lipschitz 梯度,我们表明这些梯度也在方向上收敛,并渐近地与梯度流路径对齐,这对间隔最大化、显著图收敛以及若干其他设定有影响。我们的分析补充且与著名的神经正切理论和平均场理论不同,特别地不对网络宽度和初始化作要求,而仅要求完美的分类精度。证明通过发展 o-极小结构中可定义函数的无界非光滑 Kurdyka-{\L}ojasiewicz 不等式理论进行,并且也适用于深度学习之外。

关键词

引用

@article{arxiv.2006.06657,
  title  = {Directional convergence and alignment in deep learning},
  author = {Ziwei Ji and Matus Telgarsky},
  journal= {arXiv preprint arXiv:2006.06657},
  year   = {2020}
}

备注

To appear, NeuRIPS 2020