深度学习中梯度的数学分析
机器学习
2025-01-28 v1 数值分析
数值分析
摘要
深度学习算法——通常由由随机梯度下降 (SGD) 优化方法训练的深度人工神经网络 (ANN) 类别构成——如今已是许多科学、工业领域以及日常生活中不可或缺的组成部分。粗略地说,最基本的形式下,ANN 可视为由仿射线性函数与所谓激活函数的多维版本序列组成的函数。其中最流行的激活函数之一是整流线性单元 (ReLU) 函数 。然而,ReLU 函数不可导,且这一缺乏光滑性通常会传递到监督学习问题的代价函数上。尽管存在这种可微性问题,深度学习实践者仍在标准深度学习库(如 {\sc TensorFlow} 或 {\sc Pytorch})中应用基于合适广义梯度的 SGD 方法。本文揭示了深度完全连接前馈 ANN 训练中此类广义梯度的准确而简洁的数学描述,并对所得广义梯度函数进行分析。具体而言,我们提供一种恰当的近似程序来唯一描述广义梯度函数,证明广义梯度是代价泛函的极限 Fréchet 次梯度,并得出结论:在代价泛函连续可微的每个开放集上,广义梯度必须与代价泛函的标准梯度一致。
关键词
引用
@article{arxiv.2501.15646,
title = {Mathematical analysis of the gradients in deep learning},
author = {Steffen Dereich and Thang Do and Arnulf Jentzen and Frederic Weber},
journal= {arXiv preprint arXiv:2501.15646},
year = {2025}
}
备注
38 pages