两层 ReLU 网络中的隐藏极小值
机器学习
2026-01-21 v4 最优化与控制
机器学习
摘要
我们考虑了在平方损失下训练具有 个输入的两层 ReLU 网络相关的优化问题,其中标签由目标网络生成。近期的工作识别出了两类不同的无穷极小值族:一类在渐近高维极限下训练损失趋于零,另一类损失保持有界且远离零。后者在经验上会被随机梯度 descent 规避,因此被称为 hidden(隐藏),这促使人们寻找区分隐藏与非隐藏极小值的解析准则。一个关键挑战在于,先前的分析表明隐藏与非隐藏极小值处的 Hessian 谱在 阶项之前是重合的,这似乎限制了谱方法的判别能力。因此我们另辟蹊径,转而研究某些使损失达到局部极小化的曲线。我们的主要结果表明,从隐藏极小值发出的弧线表现出独特的结构和对称性,这恰好源于早期分析中缺失的 阶特征值贡献。
引用
@article{arxiv.2312.16819,
title = {Hidden Minima in Two-Layer ReLU Networks},
author = {Yossi Arjevani},
journal= {arXiv preprint arXiv:2312.16819},
year = {2026}
}