中文

在线学习与信息指数:论批量大小的重要性及时间/复杂度权衡

机器学习 2024-09-06 v1 机器学习

摘要

我们研究了批量大小nbn_b对使用单遍随机梯度下降(SGD)训练两层神经网络在各项同性协变量的多指标目标函数上的迭代时间TT的影响。我们刻画了最小化迭代时间的最优批量大小,该大小是目标难度的函数,而难度由信息指数表征。我们表明,使用大批量nbd2n_b \lesssim d^{\frac{\ell}{2}}进行梯度更新可以在不改变总样本复杂度的情况下最小化训练时间,其中\ell是待学习目标的信息指数\citep{arous2021online},dd是输入维度。然而,大于nbd2n_b \gg d^{\frac{\ell}{2}}的批量大小不利于改善SGD的时间复杂度。我们通过一种不同的训练协议——相关损失SGD——可证明地克服了这一基本限制,该协议抑制了损失函数中的自相关项。我们表明,可以通过一个低维常微分方程(ODE)系统来跟踪训练进度。最后,我们通过数值实验验证了我们的理论结果。

关键词

引用

@article{arxiv.2406.02157,
  title  = {Online Learning and Information Exponents: On The Importance of Batch size, and Time/Complexity Tradeoffs},
  author = {Luca Arnaboldi and Yatin Dandi and Florent Krzakala and Bruno Loureiro and Luca Pesce and Ludovic Stephan},
  journal= {arXiv preprint arXiv:2406.02157},
  year   = {2024}
}