中文

梯度下降最大化齐次神经网络的边界

机器学习 2021-01-01 v4 神经与进化计算 机器学习

摘要

本文研究梯度下降算法在齐次神经网络中的隐式正则化,包括具有 ReLU 或 LeakyReLU 激活函数的全连接神经网络和卷积神经网络。特别地,我们研究优化任意齐次模型(可能非光滑)的逻辑损失或交叉熵损失的梯度下降或梯度流(即步长无穷小的梯度下降),并证明如果训练损失降至某一阈值以下,则我们可以定义一个随时间增加的归一化边界的平滑版本。我们还提出了一个与边界最大化相关的自然约束优化问题,并证明归一化边界及其平滑版本均收敛至该优化问题某一 KKT 点的目标值。我们的结果推广了先前针对单层或多层线性网络逻辑回归的结果,并在比先前齐次光滑神经网络结果更弱的假设下提供了更定量的收敛结果。我们在 MNIST 和 CIFAR-10 数据集上进行了若干实验以验证我们的理论发现。最后,由于边界与鲁棒性密切相关,我们讨论了延长训练时间以提升模型鲁棒性的潜在益处。

关键词

引用

@article{arxiv.1906.05890,
  title  = {Gradient Descent Maximizes the Margin of Homogeneous Neural Networks},
  author = {Kaifeng Lyu and Jian Li},
  journal= {arXiv preprint arXiv:1906.05890},
  year   = {2021}
}

备注

52 pages, 9 figures; Published in ICLR 2020; Corrected typos and added a few references