中文

OmniMAE:图像与视频上的单模型掩码预训练

计算机视觉与模式识别 2023-06-01 v2 人工智能 机器学习 机器学习

摘要

基于Transformer的架构已在包括图像和视频在内的多种视觉领域中具备竞争力。虽然先前的工作孤立地研究这些模态,但拥有通用架构意味着可以用单一统一模型训练多种视觉模态。先前的统一建模尝试通常使用为视觉任务定制的架构,或取得比单模态模型更差的性能。在这项工作中,我们展示了掩码自编码可用于在图像和视频上训练一个简单的视觉Transformer(Vision Transformer),且无需任何标注数据。该单一模型学习到的视觉表征在图像和视频基准上可与单模态表征媲美或更优,同时采用更简单的架构。此外,该模型可通过丢弃90%的图像块和95%的视频块来学习,从而实现巨型模型架构的极速训练。具体而言,我们展示了我们的单一ViT-Huge模型经微调可在ImageNet上达到86.6%,在具有挑战性的Something Something-v2视频基准上达到75.5%,刷新了当前最佳水平。

关键词

引用

@article{arxiv.2206.08356,
  title  = {OmniMAE: Single Model Masked Pretraining on Images and Videos},
  author = {Rohit Girdhar and Alaaeldin El-Nouby and Mannat Singh and Kalyan Vasudev Alwala and Armand Joulin and Ishan Misra},
  journal= {arXiv preprint arXiv:2206.08356},
  year   = {2023}
}

备注

CVPR 2023. Code/models: https://github.com/facebookresearch/omnivore