中文

关于过参数化问题收敛性:神经网络组成结构的内在性质

机器学习 2025-11-14 v1 人工智能 系统与控制 系统与控制 最优化与控制

摘要

本文探讨了神经网络组成结构如何塑造其优化景观和训练动力学。我们分析了与过参数化优化问题相关的梯度流,可解释为具有线性激活函数的神经网络训练。惊人地,我们展示了对于任何proper且实解析的代价函数,都可以推导出全局收敛性。随后我们专门针对scalar值代价函数进行分析,其中可以完全描述景观的几何结构。在此设置下,我们证明了关键结构特征(如鞍点的位置和稳定性)在所有可接受代价函数之间都是普适的,仅取决于过参数化表示,而非问题特定细节。此外,我们展示了根据初始化方式,收敛可以被任意加速,测量指标为本文引入的不平衡度量。最后,我们讨论了这些见解如何推广到具有 sigmoid 激活函数的神经网络,展示通过一个简单例子,哪些几何和动力学特性在线性情况之外仍然持续。

关键词

引用

@article{arxiv.2511.09810,
  title  = {On the Convergence of Overparameterized Problems: Inherent Properties of the Compositional Structure of Neural Networks},
  author = {Arthur Castello Branco de Oliveira and Dhruv Jatkar and Eduardo Sontag},
  journal= {arXiv preprint arXiv:2511.09810},
  year   = {2025}
}