中文

Img2Vec:高令牌多样性的教师模型助力掩码自编码器

计算机视觉与模式识别 2023-04-26 v1

摘要

我们提出一种用于深度特征掩码图像建模(MIM)的图像到向量(Img2Vec)流程。为研究哪类深度特征适合作为MIM的学习目标,我们提出了一个简单的MIM框架,使用一系列训练良好的自监督模型将图像转换为特征向量作为MIM的学习目标,其中特征提取器也称为教师模型。令人惊讶的是,我们通过实证发现,MIM模型从较轻量模型(如ResNet-50,26M)生成的图像特征中获益更多,而非来自如基于Transformer的模型(如ViT-Large,307M)这类笨重教师。为分析这一显著现象,我们设计了一个新属性——令牌多样性(token diversity),以评估不同模型生成特征的特性。令牌多样性衡量不同令牌间的特征不相似度。通过大量实验与可视化,我们推测除了大模型可提升MIM这一共识外,教师模型的高令牌多样性也至关重要。基于上述讨论,Img2Vec采用高令牌多样性的教师模型生成图像特征。Img2Vec在ImageNet无标签数据上用ViT-B预训练,在微调上取得85.1%的top-1准确率。此外,我们将Img2Vec扩展至更大模型ViT-L和ViT-H,分别获得86.7%和87.5%的准确率。它还在其他下游任务上取得最先进结果,例如在COCO上51.8% mAP、在ADE20K上50.7% mIoU。Img2Vec是一个简单而有效的深度特征MIM学习框架,在代表性视觉任务上实现了优异的综合性能。

关键词

引用

@article{arxiv.2304.12535,
  title  = {Img2Vec: A Teacher of High Token-Diversity Helps Masked AutoEncoders},
  author = {Heng Pan and Chenyang Liu and Wenxiao Wang and Li Yuan and Hongfa Wang and Zhifeng Li and Wei Liu},
  journal= {arXiv preprint arXiv:2304.12535},
  year   = {2023}
}