两层网络训练中的早期对齐是一把双刃剑
机器学习
2025-09-16 v3 机器学习
摘要
使用一阶优化方法训练神经网络是深度学习实证成功的核心。初始化规模是一个关键因素,因为小初始化通常与特征学习机制相关联,其中梯度下降隐式地偏向于简单解。这项工作对 Maennel 等人 (2018) 最初提出的早期对齐阶段提供了通用且定量的描述。对于小初始化和具有一个隐藏 ReLU 层的网络,训练动力学的早期阶段会导致神经元向关键方向对齐。这种对齐诱导了网络的稀疏表示,这直接与收敛时梯度流的隐式偏差相关。然而,这种诱导稀疏性的对齐是以最小化训练目标的困难为代价的:我们还提供了一个简单的数据示例,其中过参数化网络未能收敛到全局最小值,而仅收敛到一个虚假的驻点。
引用
@article{arxiv.2401.10791,
title = {Early alignment in two-layer networks training is a two-edged sword},
author = {Etienne Boursier and Nicolas Flammarion},
journal= {arXiv preprint arXiv:2401.10791},
year = {2025}
}
备注
Official JMLR version