中文

前馈神经网络高斯-牛顿法的黎曼优化视角

最优化与控制 2025-12-23 v5 人工智能 机器学习 系统与控制 系统与控制 机器学习

摘要

本文建立了高斯-牛顿法在训练具有光滑激活函数的神经网络时的非渐近收敛界。在欠参数化机制下,参数空间中的高斯-牛顿梯度流在函数空间的低维嵌入子流形上诱导出黎曼梯度流。利用黎曼优化工具,我们在适当选择的输出缩放下建立了损失的测地Polyak-Lojasiewicz和Lipschitz光滑条件,从而以与Gram矩阵条件数无关的显式速率几何收敛到最优类内预测器。在过参数化机制下,我们提出了自适应、曲率感知的正则化调度,确保以与神经正切核最小特征值无关的速率几何收敛到全局最优,且在局部上与损失的强凸模量无关。这些结果表明,在一阶方法因核矩阵和损失景观病态而收敛缓慢的设置中,高斯-牛顿法实现了加速收敛速率。

关键词

引用

@article{arxiv.2412.14031,
  title  = {A Riemannian Optimization Perspective of the Gauss-Newton Method for Feedforward Neural Networks},
  author = {Semih Cayci},
  journal= {arXiv preprint arXiv:2412.14031},
  year   = {2025}
}