中文

小批量训练为二阶优化器带来更优泛化性能

机器学习 2023-07-24 v1

摘要

训练现代机器学习中使用的深度神经网络(DNNs)计算代价高昂。因此,机器学习研究者依赖随机一阶方法进行训练,并辅以大量人工调参以获得良好性能。为更好理解不同随机算法(包括二阶方法)的性能差异性,我们开展了一项实证研究,将性能视为同一模型多次训练会话中的响应变量。利用带交互作用的双因素方差分析(ANOVA),我们表明训练中所用批量大小对方法的峰值精度具有统计显著影响,且全批量大体表现最差。此外,我们发现二阶优化器(SOOs)在特定批量大小下通常表现出显著更低的方差,意味着它们可能需要更少的超参数调优,从而缩短模型训练的总体求解时间。

关键词

引用

@article{arxiv.2307.11684,
  title  = {Minibatching Offers Improved Generalization Performance for Second Order Optimizers},
  author = {Eric Silk and Swarnita Chakraborty and Nairanjana Dasgupta and Anand D. Sarwate and Andrew Lumsdaine and Tony Chiang},
  journal= {arXiv preprint arXiv:2307.11684},
  year   = {2023}
}

备注

14 pages, 6 figures, 5 tables