中文

ViC-MAE:基于对比掩码自编码器的图像与视频自监督表示学习

计算机视觉与模式识别 2024-10-04 v3

摘要

我们提出 ViC-MAE,一种结合掩码自编码器(MAE)与对比学习的模型。ViC-MAE 通过池化在 MAE 重建损失下学习的局部表示获得全局特征,并在跨图像与视频帧的对比目标下利用该表示进行训练。我们表明,在 ViC-MAE 下学习的视觉表示能很好地泛化到视频与图像分类任务。特别地,在从视频到 ImageNet-1k 的迁移学习上,与近期提出的 OmniMAE 相比,ViC-MAE 在使用相同数据训练时取得了 86% 的 top-1 准确率(+1.3% 绝对提升),在使用额外数据训练时取得了 87.1%(+2.4% 绝对提升)的 SOTA 迁移学习性能。同时,ViC-MAE 在视频基准上超越多数其他方法,在具有挑战性的 Something-Something-v2 视频基准上取得 75.9% 的 top-1 准确率。当在来自多种数据集组合的视频和图像上训练时,我们的方法在视频与图像分类基准之间保持了均衡的迁移学习性能,仅以微弱劣势位居最佳监督方法之后。

关键词

引用

@article{arxiv.2303.12001,
  title  = {ViC-MAE: Self-Supervised Representation Learning from Images and Video with Contrastive Masked Autoencoders},
  author = {Jefferson Hernandez and Ruben Villegas and Vicente Ordonez},
  journal= {arXiv preprint arXiv:2303.12001},
  year   = {2024}
}

备注

Published at ECCV 2024