中文

SAD 神经网络:发散的梯度流与通过 o-最小结构的渐近最优性

机器学习 2026-01-13 v3 逻辑 最优化与控制 机器学习

摘要

我们研究了完全连接前馈神经网络损失景观的梯度流,这些网络使用常见的连续可微激活函数,如 logistic、hyperbolic tangent、softplus 或 GELU 函数。我们证明了梯度流要么收敛于临界点,要么在损失收敛至渐近临界值时发散到无穷大。此外,我们证明存在一个阈值 ε>0\varepsilon>0,使得任何在最优水平以上不超过 ε\varepsilon 初始化的梯度流的损失值会收敛至最优值。对于多项式目标函数和足够大的网络结构和数据集,我们证明最优损失值为零,只能以渐近方式实现。从该设置出发,我们推导出任何具有良好初始化的梯度流发散到无穷大的主要结果。我们的证明在很大程度上依赖于 o-最小结构的几何。我们通过数值实验确认了这些理论发现,并将我们的研究扩展到更现实的情境,在其中我们观察到类似的行为。

关键词

引用

@article{arxiv.2505.09572,
  title  = {SAD Neural Networks: Divergent Gradient Flows and Asymptotic Optimality via o-minimal Structures},
  author = {Julian Kranz and Davide Gallon and Steffen Dereich and Arnulf Jentzen},
  journal= {arXiv preprint arXiv:2505.09572},
  year   = {2026}
}

备注

Accepted for NeurIPS 2025, 30 pages, 6 figures. The result about continuous data distributions now has an additional assumption since a gap was identified in a previous version of the proof