中文

深度学习中梯度的数学分析

机器学习 2025-01-28 v1 数值分析 数值分析

摘要

深度学习算法——通常由由随机梯度下降 (SGD) 优化方法训练的深度人工神经网络 (ANN) 类别构成——如今已是许多科学、工业领域以及日常生活中不可或缺的组成部分。粗略地说,最基本的形式下,ANN 可视为由仿射线性函数与所谓激活函数的多维版本序列组成的函数。其中最流行的激活函数之一是整流线性单元 (ReLU) 函数 Rxmax{x,0}R\mathbb{R} \ni x \mapsto \max\{ x, 0 \} \in \mathbb{R}。然而,ReLU 函数不可导,且这一缺乏光滑性通常会传递到监督学习问题的代价函数上。尽管存在这种可微性问题,深度学习实践者仍在标准深度学习库(如 {\sc TensorFlow} 或 {\sc Pytorch})中应用基于合适广义梯度的 SGD 方法。本文揭示了深度完全连接前馈 ANN 训练中此类广义梯度的准确而简洁的数学描述,并对所得广义梯度函数进行分析。具体而言,我们提供一种恰当的近似程序来唯一描述广义梯度函数,证明广义梯度是代价泛函的极限 Fréchet 次梯度,并得出结论:在代价泛函连续可微的每个开放集上,广义梯度必须与代价泛函的标准梯度一致。

关键词

引用

@article{arxiv.2501.15646,
  title  = {Mathematical analysis of the gradients in deep learning},
  author = {Steffen Dereich and Thang Do and Arnulf Jentzen and Frederic Weber},
  journal= {arXiv preprint arXiv:2501.15646},
  year   = {2025}
}

备注

38 pages