前馈神经网络高斯-牛顿法的黎曼优化视角
最优化与控制
2025-12-23 v5 人工智能
机器学习
系统与控制
系统与控制
机器学习
摘要
本文建立了高斯-牛顿法在训练具有光滑激活函数的神经网络时的非渐近收敛界。在欠参数化机制下,参数空间中的高斯-牛顿梯度流在函数空间的低维嵌入子流形上诱导出黎曼梯度流。利用黎曼优化工具,我们在适当选择的输出缩放下建立了损失的测地Polyak-Lojasiewicz和Lipschitz光滑条件,从而以与Gram矩阵条件数无关的显式速率几何收敛到最优类内预测器。在过参数化机制下,我们提出了自适应、曲率感知的正则化调度,确保以与神经正切核最小特征值无关的速率几何收敛到全局最优,且在局部上与损失的强凸模量无关。这些结果表明,在一阶方法因核矩阵和损失景观病态而收敛缓慢的设置中,高斯-牛顿法实现了加速收敛速率。
引用
@article{arxiv.2412.14031,
title = {A Riemannian Optimization Perspective of the Gauss-Newton Method for Feedforward Neural Networks},
author = {Semih Cayci},
journal= {arXiv preprint arXiv:2412.14031},
year = {2025}
}