准渐近与非准渐近收敛性分析:单调递增批量大小下的准超几何动量
机器学习
2025-09-22 v3 最优化与控制
摘要
动量方法最初是为了在具有凸目标函数的确定性设置下优于随机梯度下降(SGD)。然而,尽管它们被广泛应用于深度神经网络——这是一种代表性的随机非凸优化问题——但其在此类设置下的理论依据仍有限。准超几何动量(QHM)是一种概括各种动量方法的算法,旨在更好地理解整类基于动量的方法。本文给出单调递增批量大小下的 mini-batch QHM的准渐近收敛性与非准渐近收敛性结果。我们指出,实现准渐近收敛需要学习率衰减或批量大小递增。由于学习率衰减会损害非准渐近收敛性,我们演示了在不衰减学习率的情况下使用单调递增批量大小的 mini-batch QHM是一种更有效的策略。我们的实验表明,即使批量大小有限增加,也能为训练神经网络提供收益。
引用
@article{arxiv.2506.23544,
title = {Both Asymptotic and Non-Asymptotic Convergence of Quasi-Hyperbolic Momentum using Increasing Batch Size},
author = {Kento Imaizumi and Hideaki Iiduka},
journal= {arXiv preprint arXiv:2506.23544},
year = {2025}
}
备注
Accepted at ACML 2025