中文

两层网络训练中的早期对齐是一把双刃剑

机器学习 2025-09-16 v3 机器学习

摘要

使用一阶优化方法训练神经网络是深度学习实证成功的核心。初始化规模是一个关键因素,因为小初始化通常与特征学习机制相关联,其中梯度下降隐式地偏向于简单解。这项工作对 Maennel 等人 (2018) 最初提出的早期对齐阶段提供了通用且定量的描述。对于小初始化和具有一个隐藏 ReLU 层的网络,训练动力学的早期阶段会导致神经元向关键方向对齐。这种对齐诱导了网络的稀疏表示,这直接与收敛时梯度流的隐式偏差相关。然而,这种诱导稀疏性的对齐是以最小化训练目标的困难为代价的:我们还提供了一个简单的数据示例,其中过参数化网络未能收敛到全局最小值,而仅收敛到一个虚假的驻点。

关键词

引用

@article{arxiv.2401.10791,
  title  = {Early alignment in two-layer networks training is a two-edged sword},
  author = {Etienne Boursier and Nicolas Flammarion},
  journal= {arXiv preprint arXiv:2401.10791},
  year   = {2025}
}

备注

Official JMLR version