利用掩码图像建模改进有监督表示学习
计算机视觉与模式识别
2023-12-05 v1
摘要
在计算机视觉中,使用有标签数据监督来训练视觉嵌入一直是表示学习的事实标准。受近期在自监督表示学习中采用掩码图像建模(MIM)取得成功的启发,我们提出了一种简单而有效的方案,可轻松地将 MIM 集成到现有有监督训练范式中。在我们的设计中,除了对视觉 Transformer 图像编码器施加原有的分类任务外,我们在编码器之上增加一个浅层 Transformer 解码器,并引入一项 MIM 任务,试图基于掩码图像输入重建图像 token。我们证明,在架构改动极小且推理无额外开销的情况下,该方案能够提升所学表示在分类、图像检索与语义分割等下游任务上的质量。我们在公开基准上对我们的方案进行了全面研究与评估。在 ImageNet-1k 上,我们的 ViT-B/14 模型达到了 81.72% 的验证准确率,比基线模型高出 2.01%。在 ImageNet-1k 的 K 近邻图像检索评估中,同一模型比基线高出 1.32%。我们还表明,该方案可以轻松扩展到更大的模型与数据集。代码与检查点将予以发布。
引用
@article{arxiv.2312.00950,
title = {Improve Supervised Representation Learning with Masked Image Modeling},
author = {Kaifeng Chen and Daniel Salz and Huiwen Chang and Kihyuk Sohn and Dilip Krishnan and Mojtaba Seyedhosseini},
journal= {arXiv preprint arXiv:2312.00950},
year = {2023}
}