深度学习中以几何自适应梯度下降实现均匀指数速率的全局 $\mathcal{L}^2$ 最小化
机器学习
2026-05-26 v6 人工智能
数学物理
math.MP
最优化与控制
机器学习
摘要
我们考虑深度学习(DL)网络中的监督学习场景,并利用可定义梯度下降流的黎曼度量的选择任意性(微分几何的一般事实)。在 DL 的标准方法中,参数空间(权重与偏置)上的梯度流是相对于欧氏度量定义的。而此处,我们选取 DL 网络输出层上相对于欧氏度量的梯度流。这自然诱导出参数空间中两种修正版梯度下降流,一种适用于过参数化情形,另一种适用于欠参数化情形。在过参数化情形下,我们证明:若秩条件成立,则修正梯度下降的所有轨道都以均匀指数收敛速率将 代价驱动至其全局极小;从而对任意给定的全局极小邻近度可获得先验停止时间。我们指出后者与次黎曼几何的关联。此外,我们将上述框架推广至秩条件不成立的情形;特别地,我们表明局部平衡仅可能在发生秩损失时出现,且通常它们并非孤立点,而是参数空间临界子流形的元素。
引用
@article{arxiv.2311.15487,
title = {Global $\mathcal{L}^2$ minimization at uniform exponential rate via geometrically adapted gradient descent in Deep Learning},
author = {Thomas Chen},
journal= {arXiv preprint arXiv:2311.15487},
year = {2026}
}
备注
AMS Latex, 21 pages. Typos corrected, references and comments added