梯度下降不够格:非可微性影响神经网络训练的三种方式
机器学习
2025-07-31 v12 计算机视觉与模式识别
摘要
本文批判性地审视了应用于非可微函数的梯度方法(NGDM)与针对可微函数的经典梯度下降(GD)之间的根本区别,揭示了当前深度学习优化理论中的显著空白。我们证明,与 GD 相比,NGDM 表现出截然不同的收敛特性,这强烈质疑了基于 -光滑性的广泛神经网络收敛文献对非光滑神经网络的适用性。我们的分析揭示了 NGDM 在 正则化问题上的解存在矛盾行为,即增加正则化反而导致最优解的 范数更大。这一发现对广泛采用的用于网络剪枝的 惩罚技术提出了质疑。我们进一步挑战了诸如 RMSProp 等优化算法在可微和非可微情境下表现相似的普遍假设。通过扩展稳定性边缘(Edge of Stability)现象,我们证明了它发生在更广泛的函数类中,包括 Lipschitz 连续凸可微函数。这一发现对其在非凸、非可微神经网络(特别是使用 ReLU 激活的网络)中的相关性和解释提出了重要问题。我们的工作识别了有影响力的文献中对 NDGM 的关键误解,这些误解源于对强光滑性假设的过度依赖。这些发现要求重新评估深度学习中的优化动力学,强调了为分析这些复杂系统建立更细致的理论基础的关键需求。
引用
@article{arxiv.2401.08426,
title = {GD doesn't make the cut: Three ways that non-differentiability affects neural network training},
author = {Siddharth Krishna Kumar},
journal= {arXiv preprint arXiv:2401.08426},
year = {2025}
}
备注
Punctuations, more proof clean ups