SGD中的弹射现象:训练损失中的尖峰及其通过特征学习对泛化的影响
机器学习
2024-06-07 v3 最优化与控制
机器学习
摘要
在本文中,我们首先对使用随机梯度下降(SGD)训练神经网络时训练损失中频繁出现的尖峰给出一种解释。我们提供的证据表明,SGD训练损失中的尖峰是“弹射(catapults)”,这是一种最初在[Lewkowycz et al. 2020]的大学习率GD中观察到的优化现象。我们通过实验表明,对于GD和SGD,这些弹射都发生在由切向核(tangent kernel)前几个特征向量所张成的低维子空间中。其次,我们提出一种解释,说明弹射如何通过证明弹射能够增加与真实预测器的平均梯度外积(AGOP)的对齐来促进特征学习,从而带来更好的泛化。此外,我们证明SGD中更小的批量大小会诱发更多数量的弹射,从而改善AGOP对齐与测试性能。
引用
@article{arxiv.2306.04815,
title = {Catapults in SGD: spikes in the training loss and their impact on generalization through feature learning},
author = {Libin Zhu and Chaoyue Liu and Adityanarayanan Radhakrishnan and Mikhail Belkin},
journal= {arXiv preprint arXiv:2306.04815},
year = {2024}
}
备注
ICML 2024