理解大批量训练深度神经网络泛化差距的新视角
机器学习
2022-10-25 v1 计算机视觉与模式识别
摘要
深度神经网络(DNNs)通常使用各种形式的小批量梯度下降算法进行优化。小批量梯度下降的一个主要动机是,在选择合适的批量大小后,可最优地利用现有计算资源(包括并行化)以实现快速模型训练。然而,许多工作报道称,当训练批量大小超过一定限度后,模型泛化能力会逐步下降。这是一种通常被称为泛化差距的现象。尽管已有若干工作提出了缓解泛化差距问题的不同方法,但文献中仍缺乏对泛化差距的统一解释。这一点尤为重要,因为近期工作观察到,若干已提出的泛化差距问题解决方案(如学习率缩放与增加训练预算)实际上并未真正解决该问题。因此,本文的主要论述是探究并为大批量训练的 DNNs 泛化损失的根源提供新视角。我们的分析表明,较大的训练批量大小会导致单元激活(即输出)张量的近秩损失增加,进而影响模型优化与泛化。我们使用 CIFAR-10、CIFAR-100、Fashion-MNIST 与 MNIST 数据集,在 VGG-16、残差网络(ResNet-56)与 LeNet-5 等流行 DNN 模型上进行了大量实验以作验证。
引用
@article{arxiv.2210.12184,
title = {A New Perspective for Understanding Generalization Gap of Deep Neural Networks Trained with Large Batch Sizes},
author = {Oyebade K. Oyedotun and Konstantinos Papadopoulos and Djamila Aouada},
journal= {arXiv preprint arXiv:2210.12184},
year = {2022}
}