梯度下降在浅层ReLU网络训练中可证明地逃离鞍点
机器学习
2024-09-12 v2 动力系统
最优化与控制
摘要
动力系统理论近来被应用于优化中,以证明梯度下降算法绕过损失函数所谓的严格鞍点。然而,在许多现代机器学习应用中,所需的规律性条件并不满足。本文中,我们证明了相关动力系统结果(中心稳定流形定理)的一个变体,其中放宽了部分规律性要求。我们探讨了其对各类机器学习任务的意义,特别关注具有标量输入的浅层修正线性单元(ReLU)和带泄漏ReLU网络。基于对浅层ReLU与带泄漏ReLU网络相对于仿射目标函数的平方积分损失函数临界点的详细考察,我们表明梯度下降规避了大多数鞍点。此外,在有利的初始化条件下(由极限损失的显式阈值量化),我们证明了向全局最小值的收敛。
引用
@article{arxiv.2208.02083,
title = {Gradient descent provably escapes saddle points in the training of shallow ReLU networks},
author = {Patrick Cheridito and Arnulf Jentzen and Florian Rossmannek},
journal= {arXiv preprint arXiv:2208.02083},
year = {2024}
}