中文

深入探究掩码图像建模中的数据缩放

计算机视觉与模式识别 2023-05-25 v1

摘要

理解自监督学习方法能否随无限数据缩放对于训练大规模模型至关重要。在本工作中,我们对掩码图像建模(MIM)方法(如MAE)用于视觉识别的缩放能力进行了实证研究。与大多数依赖广泛使用、人工策划且以物体为中心的ImageNet数据集的先前工作不同,我们更进一步,提出在更实际的设定中研究该问题。具体而言,我们利用网络收集的Coyo-700M数据集。我们从Coyo数据集中随机采样不同数量的训练图像,并构建一系列包含0.5M、1M、5M、10M和100M图像的自数据集用于预训练。我们的目标是研究在随不同规模数据和模型缩放时,下游任务性能如何变化。该研究表明:1) 当训练数据规模相对较小时,MIM可视为提升模型容量的有效方法;2) 强重建目标可赋予模型在下游任务上更强的容量;3) 在大多数场景下MIM预训练是数据无关的,这意味着采样预训练数据的策略并不关键。我们希望这些观察能为未来MIM研究提供有价值的见解。

关键词

引用

@article{arxiv.2305.15248,
  title  = {Delving Deeper into Data Scaling in Masked Image Modeling},
  author = {Cheng-Ze Lu and Xiaojie Jin and Qibin Hou and Jun Hao Liew and Ming-Ming Cheng and Jiashi Feng},
  journal= {arXiv preprint arXiv:2305.15248},
  year   = {2023}
}