深度学习网络的几何结构及全局 ${\mathcal L}^2$ 极小值的构造
机器学习
2024-03-15 v4 人工智能
数学物理
math.MP
最优化与控制
机器学习
摘要
在本文中,我们显式地确定了欠参数化深度学习(DL)网络中 代价函数的局部和全局极小元;我们的主要目标是阐明其几何结构与性质。我们通过直接构造实现这一点,全文未调用任何梯度下降流。我们具体考虑 个隐藏层、ReLU 斜坡激活函数、 Schatten 类(或 Hilbert-Schmidt)代价函数、维数相等 的输入与输出空间 ,以及同样定义在 上的隐藏层;训练输入假定为充分聚类的。训练输入规模 可任意大——因此我们考虑的是欠参数化机制。更一般的设定留待未来工作。我们对 情形构造了代价函数全局最小值的一族显式极小元,并证明其是退化的。此外,我们确定了代价函数的 个互异退化局部极小点集。在此所述语境中,DL 网络隐藏层的串接被重新解释为一种递归应用的{\em 截断映射},它通过最小化训练输入的噪信比来“筛选”训练输入。
引用
@article{arxiv.2309.10639,
title = {Geometric structure of Deep Learning networks and construction of global ${\mathcal L}^2$ minimizers},
author = {Thomas Chen and Patricia Muñoz Ewald},
journal= {arXiv preprint arXiv:2309.10639},
year = {2024}
}
备注
AMS Latex, 22 pages. Typos corrected, slightly extended