中文

EfficientTrain:探索用于训练视觉骨干网络的广义课程学习

计算机视觉与模式识别 2023-08-17 v3 人工智能 机器学习

摘要

现代深度网络的优越性能通常伴随着高昂的训练过程。本文提出了一种用于高效训练视觉骨干网络(如视觉 Transformer)的新课程学习方法。我们的工作受到深度网络固有学习动态的启发:我们通过实验表明,在较早的训练阶段,模型主要学习识别每个样本中一些“更易学习”的判别模式,例如图像的低频分量以及数据增强前的原始信息。受此现象驱动,我们提出了一种课程,其中模型在每个 epoch 始终利用全部训练数据,而课程从仅暴露每个样本的“更易学习”模式开始,并逐渐引入更困难的模式。为实现这一想法,我们 1)在输入的傅里叶频谱中引入裁剪操作,使模型能够高效地从仅低频分量中学习;2)证明暴露原始图像的特征等同于采用更弱的数据增强;3)将 1)和 2)整合,并设计了一个带有贪心搜索算法的课程学习调度策略。所得方法 EfficientTrain 简单、通用,却出奇有效。作为一种即用型方法,它在 ImageNet-1K/22K 上以不损失精度的代价,将多种流行模型(如 ResNet、ConvNeXt、DeiT、PVT、Swin 和 CSWin)的挂钟训练成本降低 >1.5 倍。它对于自监督学习(如 MAE)同样有效。代码见 https://github.com/LeapLabTHU/EfficientTrain。

关键词

引用

@article{arxiv.2211.09703,
  title  = {EfficientTrain: Exploring Generalized Curriculum Learning for Training Visual Backbones},
  author = {Yulin Wang and Yang Yue and Rui Lu and Tianjiao Liu and Zhao Zhong and Shiji Song and Gao Huang},
  journal= {arXiv preprint arXiv:2211.09703},
  year   = {2023}
}

备注

ICCV 2023