关于掩码图像建模中的数据缩放
计算机视觉与模式识别
2022-06-10 v1
摘要
自监督学习的一个重要目标是使模型预训练能从几乎无限的数据中获益。然而,近来流行的一种方法,即掩码图像建模(MIM),被怀疑无法从更大数据中获益。本文通过大量实验打破这一误解,数据规模从 ImageNet-1K 的 10% 到完整 ImageNet-22K,模型规模从 4900 万到 10 亿,训练长度从 12.5 万次迭代到 50 万次迭代。我们的研究揭示:(i) 掩码图像建模同样需要更大数据,我们观察到非常大的模型在相对小的数据上过拟合;(ii) 训练长度至关重要,采用掩码图像建模训练的大模型可从更大数据与更长训练中获益;(iii) 预训练中的验证损失是衡量模型在多项任务上微调表现的良好指标。该观察使我们能提前预评估预训练模型,而无需对下游任务进行代价高昂的试错评估。我们希望我们的发现能增进对掩码图像建模缩放能力的理解。
引用
@article{arxiv.2206.04664,
title = {On Data Scaling in Masked Image Modeling},
author = {Zhenda Xie and Zheng Zhang and Yue Cao and Yutong Lin and Yixuan Wei and Qi Dai and Han Hu},
journal= {arXiv preprint arXiv:2206.04664},
year = {2022}
}