中文

深度学习中零损失全局 ${\mathcal L}^2$ 极小化器不可由梯度下降逼近

机器学习 2025-05-26 v3 人工智能 数学物理 math.MP 最优化与控制 机器学习

摘要

我们分析深度学习中梯度下降算法的几何特性,并详细讨论在欠参数化 DL 网络中,零损失最小化通常无法达到的情形。由此我们得出结论:无论对于 [Chen-Munoz Ewald 2023, 2024] 中构造的方法,还是对于梯度下降 [Chen 2025](其假设训练数据聚类),要产生零损失极小化器,训练输入的分布必然是非通用的。

关键词

引用

@article{arxiv.2311.07065,
  title  = {On non-approximability of zero loss global ${\mathcal L}^2$ minimizers by gradient descent in Deep Learning},
  author = {Thomas Chen and Patricia Muñoz Ewald},
  journal= {arXiv preprint arXiv:2311.07065},
  year   = {2025}
}

备注

AMS Latex, 7 pages. Typos corrected, Corollary 1.6 upgraded to Theorem, acknowledgment added