通过小批量持续性加速SGD训练
机器学习
2018-06-20 v1 机器学习
摘要
众所周知,对于大多数数据集,为随机梯度下降(SGD)使用大尺寸小批量通常会导致收敛缓慢和泛化能力差。另一方面,大批量具有极大的实际意义,因为它们允许更好地利用现代 GPU。先前关于该主题的文献集中于如何在使用大批量时调整 SGD 的主要参数(特别是学习率)。在本工作中,我们引入一种额外特性,称之为小批量持续性,其由在 K 个连续 SGD 迭代中重用同一小批量组成。这里的计算猜想是,大批量包含训练集的显著样本,因此可以承受略微过拟合它而不会使泛化变差太多。该方法旨在加速 SGD 收敛,并且还具有减少与内部 GPU 内存上数据加载相关开销的优点。我们给出了在 CIFAR-10 上使用 AlexNet 架构的计算结果,表明即使较小的持续性值(K=2 或 5)已经比标准“一次性小批量”方法(K=1)带来显著更快的收敛和相当(甚至更好)的泛化,尤其是在使用大批量时。得到的经验是,小批量持续性可以是处理大批量的一种简单而有效的方式。
引用
@article{arxiv.1806.07353,
title = {Faster SGD training by minibatch persistency},
author = {Matteo Fischetti and Iacopo Mandatelli and Domenico Salvagnin},
journal= {arXiv preprint arXiv:1806.07353},
year = {2018}
}
备注
Submitted to an international conference