中文

降低 SFO 复杂度的批量大小与学习率最优增长计划

机器学习 2025-08-08 v1 最优化与控制

摘要

深度学习模型的 unprecedented 增长已促进了重大进展,但引入了 substantial 计算瓶颈。平衡效率和收敛性的关键因素是随机梯度法中的 batch size 和 learning rate 调度。然而,naive 的这些超参数调度会降低优化效率并损害 generalization。受 recent 理论洞见的启发,我们调查了在训练期间应该如何增加 batch size 和 learning rate 以实现效率和收敛的平衡。我们基于定义为达到经验损失 ϵ\epsilon 近似 stationary point 所需的预期梯度评估次数的随机一阶 oracle (SFO) 复杂度来分析这一问题。我们在理论上推导了降低 SFO 复杂度的最优 batch size 和 learning rate 增长计划,并通过大量实验对其进行了验证。我们的结果提供了理论见解和实用指南,以实现深度学习中大规模高效批量训练。

关键词

引用

@article{arxiv.2508.05297,
  title  = {Optimal Growth Schedules for Batch Size and Learning Rate in SGD that Reduce SFO Complexity},
  author = {Hikaru Umeda and Hideaki Iiduka},
  journal= {arXiv preprint arXiv:2508.05297},
  year   = {2025}
}