EfficientTrain++:用于高效视觉骨干网络训练的广义课程学习
摘要
现代视觉骨干网络的卓越性能通常伴随着高昂的训练成本。我们通过将课程学习的思想推广到其原始表述(即使用由易到难的数据训练模型)之外,来为这一问题做出贡献。具体而言,我们将训练课程重新表述为一种软选择函数,该函数在训练过程中逐步揭示每个样本内更难的模式,而不是执行由易到难的样本选择。我们的工作受到关于视觉骨干网络学习动态的一个有趣观察的启发:在训练的早期阶段,模型主要学习识别数据中一些“较易学”的判别性模式。从频域和空间域观察时,这些模式包含低频分量,以及无失真或未经数据增强的自然图像内容。受这些发现的启发,我们提出了一种课程,其中模型在每个学习阶段始终利用所有训练数据,但首先开始接触每个样本的“较易学”模式,随着训练的进行逐渐引入更难的模式。为了以计算高效的方式实现这一想法,我们在输入的傅里叶频谱中引入裁剪操作,使模型仅从低频分量中学习。然后我们表明,通过调节数据增强的强度可以轻松实现对自然图像内容的暴露。最后,我们整合这些方面,并利用定制的搜索算法设计了课程调度。由此产生的方法 EfficientTrain++ 简单、通用,却出奇地有效。它在 ImageNet-1K/22K 上将各种流行模型的训练时间减少了 1.5-3.0 倍,且不牺牲精度。它在自监督学习(如 MAE)中也展现了有效性。
引用
@article{arxiv.2405.08768,
title = {EfficientTrain++: Generalized Curriculum Learning for Efficient Visual Backbone Training},
author = {Yulin Wang and Yang Yue and Rui Lu and Yizeng Han and Shiji Song and Gao Huang},
journal= {arXiv preprint arXiv:2405.08768},
year = {2024}
}
备注
Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Journal version of arXiv:2211.09703 (ICCV 2023). Code is available at: https://github.com/LeapLabTHU/EfficientTrain