中文

基于SGD学习的批大小阶段式扩大方法

机器学习 2020-02-28 v2 机器学习

摘要

已有研究表明,批大小会严重影响基于随机梯度下降(SGD)的学习性能,包括训练速度与泛化能力。较大的批大小通常导致较少的参数更新。在分布式训练中,较大的批大小还导致较不频繁的通信。然而,较大的批大小更容易造成泛化差距。因此,如何为 SGD 设置合适的批大小近来备受关注。尽管已提出一些设置批大小的方法,批大小问题仍未被很好解决。本文中,我们首先提供理论证明,合适的批大小与模型参数初始化和最优值之间的差距有关。基于该理论,我们提出一种称为阶段式批大小扩大(SEBS)的新方法,为 SGD 设置合适批大小。更具体地,SEBS 采用多阶段方案,并按阶段以几何方式扩大批大小。我们从理论上证明,与按阶段降低学习率的传统阶段式 SGD 相比,SEBS 能在不增加泛化误差的前提下减少参数更新次数。SEBS 适用于 SGD、动量 SGD 和 AdaGrad。在真实数据上的实证结果成功验证了 SEBS 的理论。此外,实证结果还表明 SEBS 可优于其他基线方法。

关键词

引用

@article{arxiv.2002.11601,
  title  = {Stagewise Enlargement of Batch Size for SGD-based Learning},
  author = {Shen-Yi Zhao and Yin-Peng Xie and Wu-Jun Li},
  journal= {arXiv preprint arXiv:2002.11601},
  year   = {2020}
}