中文

批大小递增的黎巴耳利 stochastic 梯度下降更快的收敛

机器学习 2025-10-14 v6 最优化与控制 机器学习

摘要

我们对黎巴耳利 stochastic 梯度下降 (RSGD) 的收敛行为进行了理论分析,发现使用递增批大小相对于使用恒定批大小可以实现更快的收敛,这不仅适用于恒定学习率,也适用于余弦衰减和多项式衰减等递减学习率。收敛速率从使用恒定批大小时的 O(T1+C)O(T^{-1}+C) 改进为使用递增批大小时的 O(T1)O(T^{-1}),其中 TT 表示总迭代次数,CC 为常数。利用主成分分析和低秩矩阵完成,我们理论和数值地研究了递增批大小对计算时间的影响,即以随机一阶 oracle (SFO) 复杂度为度量。研究发现,递增批大小会降低 RSGD 的 SFO 复杂度。此外,递增批大小还被发现能同时提供小和大恒定批大小的优势。

关键词

引用

@article{arxiv.2501.18164,
  title  = {Faster Convergence of Riemannian Stochastic Gradient Descent with Increasing Batch Size},
  author = {Kanata Oowada and Hideaki Iiduka},
  journal= {arXiv preprint arXiv:2501.18164},
  year   = {2025}
}

备注

Accepted at ACML2025