中文

随机训练对泛化并非必要

机器学习 2022-04-21 v2 最优化与控制

摘要

人们普遍认为,SGD 的隐式正则化对于我们观察到的神经网络出色的泛化行为至关重要。在这项工作中,我们证明了在 CIFAR-10 上使用现代架构时,非随机全批量训练能够取得与 SGD 相当的强劲性能。为此,我们表明,即使与经过充分研究的强基准进行比较,SGD 的隐式正则化也可以被显式正则化完全替代。我们的观察表明,全批量训练所感知到的困难可能是其优化属性以及 ML 社区在小批量训练的优化器和超参数调优上花费的时间和精力不成比例的结果。

关键词

引用

@article{arxiv.2109.14119,
  title  = {Stochastic Training is Not Necessary for Generalization},
  author = {Jonas Geiping and Micah Goldblum and Phillip E. Pope and Michael Moeller and Tom Goldstein},
  journal= {arXiv preprint arXiv:2109.14119},
  year   = {2022}
}

备注

25 pages, 6 figures. Code published at github.com/JonasGeiping/fullbatchtraining. Decompressed version of paper published at ICLR 2022