中文

深度学习网络的几何结构及全局 ${\mathcal L}^2$ 极小值的构造

机器学习 2024-03-15 v4 人工智能 数学物理 math.MP 最优化与控制 机器学习

摘要

在本文中,我们显式地确定了欠参数化深度学习(DL)网络中 L2\mathcal{L}^2 代价函数的局部和全局极小元;我们的主要目标是阐明其几何结构与性质。我们通过直接构造实现这一点,全文未调用任何梯度下降流。我们具体考虑 LL 个隐藏层、ReLU 斜坡激活函数、L2\mathcal{L}^2 Schatten 类(或 Hilbert-Schmidt)代价函数、维数相等 Q1Q\geq1 的输入与输出空间 RQ\mathbb{R}^Q,以及同样定义在 RQ\mathbb{R}^{Q} 上的隐藏层;训练输入假定为充分聚类的。训练输入规模 NN 可任意大——因此我们考虑的是欠参数化机制。更一般的设定留待未来工作。我们对 LQL\geq Q 情形构造了代价函数全局最小值的一族显式极小元,并证明其是退化的。此外,我们确定了代价函数的 2Q12^Q-1 个互异退化局部极小点集。在此所述语境中,DL 网络隐藏层的串接被重新解释为一种递归应用的{\em 截断映射},它通过最小化训练输入的噪信比来“筛选”训练输入。

关键词

引用

@article{arxiv.2309.10639,
  title  = {Geometric structure of Deep Learning networks and construction of global ${\mathcal L}^2$ minimizers},
  author = {Thomas Chen and Patricia Muñoz Ewald},
  journal= {arXiv preprint arXiv:2309.10639},
  year   = {2024}
}

备注

AMS Latex, 22 pages. Typos corrected, slightly extended