中文

权重衰减下损失景观的良性需要大规模过参数化与初始化

机器学习 2025-05-29 v1

摘要

从理论角度来看,权重衰减下神经网络的优化仍不为人所充分理解。尽管权重衰减是现代训练流程中的标准做法,但大多数理论分析集中于无正则化设置。在本工作中,我们研究了两层 ReLU 网络的 2\ell_2 正则化训练损失的损失景观。我们表明,在大规模过参数化下,即当网络宽度 mm 满足 mmin(nd,2n)m \gtrsim \min(n^d, 2^n)(其中 nn 是数据点数量,dd 是输入维度)时,该景观变得良性——即无伪局部极小值。更精确地说,在此机制下,几乎所有常数激活区域都包含一个全局极小值且无伪局部极小值。我们进一步通过正交数据的例子表明,这种程度的过参数化不仅是充分的,也是必要的。最后,我们证明,此类损失景观结果主要在大初始化机制下才具有相关性。相反,对于小初始化——对应于特征学习机制——尽管景观具有全局良性,优化仍可能收敛至伪局部极小值。

关键词

引用

@article{arxiv.2505.22578,
  title  = {Benignity of loss landscape with weight decay requires both large overparametrization and initialization},
  author = {Etienne Boursier and Matthew Bowditch and Matthias Englert and Ranko Lazic},
  journal= {arXiv preprint arXiv:2505.22578},
  year   = {2025}
}