中文

梯度下降不够格:非可微性影响神经网络训练的三种方式

机器学习 2025-07-31 v12 计算机视觉与模式识别

摘要

本文批判性地审视了应用于非可微函数的梯度方法(NGDM)与针对可微函数的经典梯度下降(GD)之间的根本区别,揭示了当前深度学习优化理论中的显著空白。我们证明,与 GD 相比,NGDM 表现出截然不同的收敛特性,这强烈质疑了基于 LL-光滑性的广泛神经网络收敛文献对非光滑神经网络的适用性。我们的分析揭示了 NGDM 在 L1L_{1} 正则化问题上的解存在矛盾行为,即增加正则化反而导致最优解的 L1L_{1} 范数更大。这一发现对广泛采用的用于网络剪枝的 L1L_{1} 惩罚技术提出了质疑。我们进一步挑战了诸如 RMSProp 等优化算法在可微和非可微情境下表现相似的普遍假设。通过扩展稳定性边缘(Edge of Stability)现象,我们证明了它发生在更广泛的函数类中,包括 Lipschitz 连续凸可微函数。这一发现对其在非凸、非可微神经网络(特别是使用 ReLU 激活的网络)中的相关性和解释提出了重要问题。我们的工作识别了有影响力的文献中对 NDGM 的关键误解,这些误解源于对强光滑性假设的过度依赖。这些发现要求重新评估深度学习中的优化动力学,强调了为分析这些复杂系统建立更细致的理论基础的关键需求。

关键词

引用

@article{arxiv.2401.08426,
  title  = {GD doesn't make the cut: Three ways that non-differentiability affects neural network training},
  author = {Siddharth Krishna Kumar},
  journal= {arXiv preprint arXiv:2401.08426},
  year   = {2025}
}

备注

Punctuations, more proof clean ups