中文

超参数接近一的深度学习优化器的临界批大小最小化随机一阶预言复杂度

机器学习 2022-08-23 v1 最优化与控制

摘要

实际结果表明,采用小常数学习率、接近一超参数以及大批量大小的深度学习优化器能够找到使损失函数最小化的深度神经网络模型参数。我们首先给出理论证据,表明动量法(Momentum)与自适应矩估计(Adam)表现良好,即在小常数学习率、接近一超参数和大批量大小下,理论性能度量的上界较小。接着,我们证明存在一种称为临界批大小(critical batch size)的批量大小,可最小化随机一阶预言(SFO)复杂度(即随机梯度计算代价),且一旦批大小超过临界批大小,SFO复杂度便会上升。最后,我们给出支持理论结果的数值结果。即数值结果表明,采用小常数学习率、接近一超参数以及最小化SFO复杂度的临界批大小的Adam比动量法和随机梯度下降(SGD)收敛更快。

关键词

引用

@article{arxiv.2208.09814,
  title  = {Critical Bach Size Minimizes Stochastic First-Order Oracle Complexity of Deep Learning Optimizer using Hyperparameters Close to One},
  author = {Hideaki Iiduka},
  journal= {arXiv preprint arXiv:2208.09814},
  year   = {2022}
}

备注

arXiv admin note: text overlap with arXiv:2112.07163