针对分段解析激活函数的神经网络梯度下降映射的非奇异性
最优化与控制
2025-10-29 v1 机器学习
摘要
深度网络训练理论已成为现代机器学习的核心问题,并激发了许多实际进步。特别是,梯度下降(GD)优化算法在近年来受到了广泛研究。关于 GD 的一个关键假设在几项近期研究中出现:GD 映射是非奇异的——它在预像下保持零测度集。关键地,这一假设被用于证明 GD 避免鞍点和最大值,并建立一种可计算的量来确定收敛到全局最小值(适用于 GD 和随机 GD)。然而,当前文献要么假设 GD 映射的非奇异性,要么施加限制性假设,例如损失函数的 Lipschitz 光滑性(例如,对于使用交叉熵损失的深层 ReLU 网络,Lipschitz 性不成立),并将分析限制在小步长的 GD 上。本文我们将神经网络图作为权重和偏置空间上的函数进行研究。我们也首次证明了具有分段解析激活函数(包括 sigmoid、ReLU、leak ReLU 等)的真实神经网络架构(包括全连接、卷积或 softmax 注意力层)上的梯度下降(GD)映射在大多数步长下的非奇异性。我们的工作显著扩展了现有关于 GD 和 SGD 收敛性的结果,保证它们适用于实际神经网络设置,并有望开启对学习动力学的进一步探索。
引用
@article{arxiv.2510.24466,
title = {Non-Singularity of the Gradient Descent map for Neural Networks with Piecewise Analytic Activations},
author = {Alexandru Crăciun and Debarghya Ghoshdastidar},
journal= {arXiv preprint arXiv:2510.24466},
year = {2025}
}