中文

SGD 是否真的发生在微小子空间中?

机器学习 2025-03-12 v3 最优化与控制 机器学习

摘要

由于深度神经网络的高维性质和复杂的损失景观,理解神经网络的训练动力学具有挑战性。最近的研究表明,在训练轨迹上,梯度大致与训练损失 Hessian 的低秩主特征子空间对齐,称为主导子空间。鉴于这种对齐,本文探索了在主导子空间内训练神经网络的问题,若可行,可能导致更高效的训练方法。我们的主要观察是,当 SGD 更新被投影到主导子空间时,训练损失不会进一步下降。这表明梯度与主导子空间之间的观察对齐是伪 spurious 的。令人惊讶的是,投影掉主导子空间的更新效果与原始更新相当,尽管移除了原更新的绝大部分组成部分。我们在包括大学习率范畴(也称为稳定边缘)、锐度感知最小化、动量和自适应优化器等实际情形中观察到类似行为。我们讨论了这种伪 spurious 对齐的主要原因和影响,为神经网络训练动力学提供了洞见。

关键词

引用

@article{arxiv.2405.16002,
  title  = {Does SGD really happen in tiny subspaces?},
  author = {Minhak Song and Kwangjun Ahn and Chulhee Yun},
  journal= {arXiv preprint arXiv:2405.16002},
  year   = {2025}
}

备注

Published at ICLR 2025