中文

两层 ReLU 网络中的简单性偏好与优化阈值

机器学习 2025-06-13 v2 机器学习

摘要

理解过参数化神经网络的泛化性仍是机器学习中的根本性挑战。大多数文献主要从插值角度研究泛化,假设参数会收敛到训练损失的全局最小值。虽然过参数化的架构确实会对典型分类任务进行插值,但这种插值范式似乎在更复杂的任务(如情境学习或扩散)中不再有效。相反,观察到在训练样本数量超过某个水平(我们称为优化阈值)后,训练的模型会从全局最小值转向训练损失的劣势局部最小值。前者对真实 population 损失的泛化性很差,而后者实际上对应于该真实损失的最小化者。本文在两层 ReLU 网络的背景下理论地探索了这一现象。我们展示了,尽管存在过参数化,网络通常会趋向于更简单的解决方案,而不是对训练数据进行插值,这可能导致对插值解决方案的测试损失发生巨大改善。我们的分析依赖于所谓的早期对齐阶段,在该阶段中,神经元会对齐到特定方向。这种方向性对齐发生在训练的早期阶段,导致网络在不收敛到训练损失的全局最小值的情况下逼近真实模型。这一偏好导致从插值转向的优化阈值,对训练模型的泛化性具有积极影响。

关键词

引用

@article{arxiv.2410.02348,
  title  = {Simplicity bias and optimization threshold in two-layer ReLU networks},
  author = {Etienne Boursier and Nicolas Flammarion},
  journal= {arXiv preprint arXiv:2410.02348},
  year   = {2025}
}

备注

ICML camera ready version