批大小递增的黎巴耳利 stochastic 梯度下降更快的收敛
机器学习
2025-10-14 v6 最优化与控制
机器学习
摘要
我们对黎巴耳利 stochastic 梯度下降 (RSGD) 的收敛行为进行了理论分析,发现使用递增批大小相对于使用恒定批大小可以实现更快的收敛,这不仅适用于恒定学习率,也适用于余弦衰减和多项式衰减等递减学习率。收敛速率从使用恒定批大小时的 改进为使用递增批大小时的 ,其中 表示总迭代次数, 为常数。利用主成分分析和低秩矩阵完成,我们理论和数值地研究了递增批大小对计算时间的影响,即以随机一阶 oracle (SFO) 复杂度为度量。研究发现,递增批大小会降低 RSGD 的 SFO 复杂度。此外,递增批大小还被发现能同时提供小和大恒定批大小的优势。
引用
@article{arxiv.2501.18164,
title = {Faster Convergence of Riemannian Stochastic Gradient Descent with Increasing Batch Size},
author = {Kanata Oowada and Hideaki Iiduka},
journal= {arXiv preprint arXiv:2501.18164},
year = {2025}
}
备注
Accepted at ACML2025