关于带标签噪声SGD的两层线性网络学习动力学
机器学习
2026-03-12 v1 人工智能
摘要
深度学习成功的一个关键因素在于梯度基于训练算法中固有的噪声所产生的隐式偏置。针对使用带噪标签提高模型泛化的经验观察,本文深入分析了随机梯度下降(SGD)中的标签噪声机制。我们聚焦于一个两层过参数化线性网络,分析标签噪声SGD的学习动力学,揭示了两阶段学习行为。在\emph{阶段I},模型权重的幅值逐渐减小,模型逃离惰性范数,进入丰富范数。在\emph{阶段II},模型权重与真实插值器之间的对齐度增加,模型最终收敛。我们的分析突显了标签噪声在驱动从惰性范数向丰富范数过渡中的关键作用,最小化地解释了其经验成功的原因。此外,我们将这些洞察扩展到锐度感知最小化(SAM),表明标签噪声SGD所遵循的原理也适用于更广泛的优化算法。大量实验,在合成和真实世界情境下均强力支持我们的理论。我们的源码已公开发布于https://github.com/a-usually/Label-Noise-SGD。
引用
@article{arxiv.2603.10397,
title = {On the Learning Dynamics of Two-layer Linear Networks with Label Noise SGD},
author = {Tongcheng Zhang and Zhanpeng Zhou and Mingze Wang and Andi Han and Wei Huang and Taiji Suzuki and Junchi Yan},
journal= {arXiv preprint arXiv:2603.10397},
year = {2026}
}
备注
Accepted to AAAI 2026(oral)