大批量训练的经验模型
机器学习
2018-12-18 v1 机器学习
摘要
在越来越多的领域中,已有研究表明深度学习模型可以使用相对较大的批量大小进行训练,而不牺牲数据效率。然而,这种大规模数据并行的极限似乎因领域而异,从 ImageNet 中数万的批量到玩 Dota 2 游戏的 RL 智能体中数百万的批量。据我们所知,对于为何这些批量大小极限不同,或者我们如何在新领域中选择正确的批量大小,概念性理解还很有限。在本文中,我们证明了一个称为梯度噪声尺度(gradient noise scale)的简单且易于测量的统计量,能够预测跨许多领域和应用的最大有用批量大小,包括多个监督学习数据集(MNIST、SVHN、CIFAR-10、ImageNet、Billion Word)、强化学习领域(Atari 和 Dota),甚至生成模型训练(SVHN 上的自编码器)。我们发现噪声尺度在训练过程中随损失下降而增大,并且主要通过改善的模型性能依赖于模型大小。我们基于经验激励的理论还描述了计算效率与时间效率之间的权衡,并提供了自适应批量大小训练收益的粗略模型。
引用
@article{arxiv.1812.06162,
title = {An Empirical Model of Large-Batch Training},
author = {Sam McCandlish and Jared Kaplan and Dario Amodei and OpenAI Dota Team},
journal= {arXiv preprint arXiv:1812.06162},
year = {2018}
}