卷积网络的大批量训练
计算机视觉与模式识别
2017-09-15 v3
摘要
加速大型卷积网络训练的一种常见方法是增加计算单元。随后使用数据并行同步随机梯度下降(SGD)进行训练,并将小批量划分到各计算单元上。随着节点数量的增加,批量大小也随之增长。但使用大批量大小进行训练往往会导致模型准确率降低。我们认为,当前大批量训练的方案(带有预热的线性学习率缩放)不够通用,训练可能会发散。为了克服这一优化困难,我们提出了一种基于逐层自适应速率缩放(LARS)的新训练算法。使用 LARS,我们将 Alexnet 扩展到 8K 的批量大小,将 Resnet-50 扩展到 32K 的批量大小,且没有准确率损失。
引用
@article{arxiv.1708.03888,
title = {Large Batch Training of Convolutional Networks},
author = {Yang You and Igor Gitman and Boris Ginsburg},
journal= {arXiv preprint arXiv:1708.03888},
year = {2017}
}