中文

论某些神经网络训练问题中伪局部极小值的无处不在性

机器学习 2023-06-16 v2 最优化与控制

摘要

我们研究具有一维实输出的深度人工神经网络训练问题的损失景观,其激活函数含有一段仿射段且隐藏层宽度至少为二。结果表明,对于所有非仿射的目标函数,此类问题拥有一连续统的伪(即非全局最优)局部极小值。与先前工作不同,我们的分析覆盖所有采样与参数化机制、一般可微损失函数、任意连续非多项式激活函数,以及有限与无限维设定。我们进一步表明,所考虑训练问题中伪局部极小值的出现是通用逼近定理的直接后果,且底层机制也导致例如LpL^p最佳逼近问题在所有不具有稠密像的网络下成为Hadamard意义下的不适定问题。后一结果亦在无局部仿射线性假设且无条件限制隐藏层时成立。

关键词

引用

@article{arxiv.2202.12262,
  title  = {On the Omnipresence of Spurious Local Minima in Certain Neural Network Training Problems},
  author = {Constantin Christof and Julia Kowalczyk},
  journal= {arXiv preprint arXiv:2202.12262},
  year   = {2023}
}

备注

Replaced numerical experiments by pointers to existing studies, added minor remarks. Published in Constructive Approximation, https://link.springer.com/article/10.1007/s00365-023-09658-w