AdAdaGrad: 自适应批量大小策略的自适应梯度方法
机器学习
2024-05-29 v3 最优化与控制
机器学习
摘要
在小批量随机梯度优化器中,批量大小的选择对于大规模模型训练中的优化和泛化性能至关重要。虽然大批量训练因硬件进步而主导大规模深度学习,但模型的泛化性能会恶化,导致“泛化间隙”现象。为缓解此问题,我们调查源自自适应抽样方法的自适应批量大小策略,这些方法最初仅用于随机梯度下降。鉴于学习率和批量大小之间的显著相互作用,以及自适应梯度方法在深度学习中占主导地位,我们强调在这些情境下采用自适应批量大小策略的必要性。我们提出 AdAdaGrad 及其标量变种 AdAdaGradNorm,这些方法在训练期间逐渐增加批量大小,同时使用 AdaGrad 和 AdaGradNorm 执行模型更新。我们证明 AdAdaGradNorm 以高概率收敛,收敛率为 以找到光滑非凸函数在 次迭代中的一阶静止点。AdAdaGrad 也在集成我们新提出的坐标级自适应批量大小策略时表现出类似的收敛性能。通过进行图像分类实验,证实了我们理论主张的有效性,突出了所提出方案在训练效率和模型泛化性能方面的优势。我们的工作揭示了在大规模模型训练中,为自适应梯度优化器采用自适应批量大小策略的潜力。
引用
@article{arxiv.2402.11215,
title = {AdAdaGrad: Adaptive Batch Size Schemes for Adaptive Gradient Methods},
author = {Tim Tsz-Kit Lau and Han Liu and Mladen Kolar},
journal= {arXiv preprint arXiv:2402.11215},
year = {2024}
}