基于对抗训练与二阶信息的神经网络大批量训练
机器学习
2020-01-06 v3 人工智能
最优化与控制
机器学习
摘要
加速随机梯度下降(SGD)计算最直接的方法是将随机选取的输入批次分布到多个处理器上。为使分布式处理器保持充分利用,需要相应增大批量大小。然而,大批量训练常导致泛化性能变差。近期提出的一种解决方案是在SGD中使用自适应批量大小。此时,从小规模进程数起步,并随训练推进扩展进程数。该方法的两大挑战在于:(i)动态重设集群规模会带来不小的开销,部分原因是当前尚不支持该操作;(ii)整体加速受限于初始较小批量的阶段。本工作中,我们通过开发一种基于Ray框架、支持自动伸缩的新自适应批量大小框架来解决这两大挑战。该框架可实现高效的弹性伸缩,重设开销可忽略不计(ResNet18 ImageNet训练耗时占比仅0.32%)。此外,我们提出一种利用二阶方法与对抗训练的新自适应批量大小训练方案。这些手段使得在训练更早阶段即可增大批量大小,从而缩短训练时间。我们在Cifar-10/100、SVHN、TinyImageNet和ImageNet数据集上,使用包括ResNets及SqueezeNext等较小网络在内的多种神经网络,对所提方法进行了广泛评估。我们的方法在准确率与SGD迭代次数(分别最高提升1%和)上均超越现有方案。重要的是,在所有这些实验中,无需任何额外超参数调优来适配我们的方法。
引用
@article{arxiv.1810.01021,
title = {Large batch size training of neural networks with adversarial training and second-order information},
author = {Zhewei Yao and Amir Gholami and Daiyaan Arfeen and Richard Liaw and Joseph Gonzalez and Kurt Keutzer and Michael Mahoney},
journal= {arXiv preprint arXiv:1810.01021},
year = {2020}
}