深度学习中零损失全局 ${\mathcal L}^2$ 极小化器不可由梯度下降逼近
机器学习
2025-05-26 v3 人工智能
数学物理
math.MP
最优化与控制
机器学习
摘要
我们分析深度学习中梯度下降算法的几何特性,并详细讨论在欠参数化 DL 网络中,零损失最小化通常无法达到的情形。由此我们得出结论:无论对于 [Chen-Munoz Ewald 2023, 2024] 中构造的方法,还是对于梯度下降 [Chen 2025](其假设训练数据聚类),要产生零损失极小化器,训练输入的分布必然是非通用的。
引用
@article{arxiv.2311.07065,
title = {On non-approximability of zero loss global ${\mathcal L}^2$ minimizers by gradient descent in Deep Learning},
author = {Thomas Chen and Patricia Muñoz Ewald},
journal= {arXiv preprint arXiv:2311.07065},
year = {2025}
}
备注
AMS Latex, 7 pages. Typos corrected, Corollary 1.6 upgraded to Theorem, acknowledgment added