降低 SFO 复杂度的批量大小与学习率最优增长计划
机器学习
2025-08-08 v1 最优化与控制
摘要
深度学习模型的 unprecedented 增长已促进了重大进展,但引入了 substantial 计算瓶颈。平衡效率和收敛性的关键因素是随机梯度法中的 batch size 和 learning rate 调度。然而,naive 的这些超参数调度会降低优化效率并损害 generalization。受 recent 理论洞见的启发,我们调查了在训练期间应该如何增加 batch size 和 learning rate 以实现效率和收敛的平衡。我们基于定义为达到经验损失 近似 stationary point 所需的预期梯度评估次数的随机一阶 oracle (SFO) 复杂度来分析这一问题。我们在理论上推导了降低 SFO 复杂度的最优 batch size 和 learning rate 增长计划,并通过大量实验对其进行了验证。我们的结果提供了理论见解和实用指南,以实现深度学习中大规模高效批量训练。
引用
@article{arxiv.2508.05297,
title = {Optimal Growth Schedules for Batch Size and Learning Rate in SGD that Reduce SFO Complexity},
author = {Hikaru Umeda and Hideaki Iiduka},
journal= {arXiv preprint arXiv:2508.05297},
year = {2025}
}