关于无放回随机梯度下降的轨迹
机器学习
2024-04-23 v2 最优化与控制
机器学习
摘要
本文研究了随机梯度下降 (SGD) 的隐式正则化效应。我们考虑无放回 SGD 的情形,这是优化大规模神经网络时通常采用的变体。我们在比 SGD 理论工作中通常考虑的更现实的制度下分析该算法,例如,我们允许学习率与海森矩阵的乘积为 ,且不指定任何模型架构、学习任务或损失(目标)函数。我们的核心理论结果是:使用无放回 SGD 进行优化在局部等价于在一个新型正则化器上执行额外的一步。这意味着无放回 SGD 的期望轨迹可以解耦为:(i) 沿高曲率方向遵循有放回 SGD(其中批次为独立同分布采样);(ii) 沿平坦方向对噪声协方差的迹进行正则化。因此,无放回 SGD 穿越平坦区域并逃离鞍点的速度可能显著快于有放回 SGD。在多个视觉任务中,该新型正则化器惩罚费雪矩阵的加权迹,从而鼓励损失海森矩阵谱的稀疏性,这与先前工作的实证观察一致。我们还解释了为何 SGD 不会在稳定性边缘进行训练(这与梯度下降 GD 不同)。
引用
@article{arxiv.2312.16143,
title = {On the Trajectories of SGD Without Replacement},
author = {Pierfrancesco Beneventano},
journal= {arXiv preprint arXiv:2312.16143},
year = {2024}
}
备注
69 pages, 6 figures