中文

一个视频能否媲美 ImageNet?从单条长无标签视频学习强图像编码器

计算机视觉与模式识别 2024-05-24 v2

摘要

自监督学习释放了将预训练扩展到数十亿图像规模的潜力,因为无需标注。但我们是否充分利用了数据?还能多节约数据?本文试图通过两点贡献来回答该问题。首先,我们研究第一人称视频并引入“Walking Tours”数据集。这些视频为高分辨率、长达数小时、单次不间断拍摄,描绘了大量物体与动作并带有自然场景转换。它们无标签且未筛选,因此对于自监督而言真实可行,并与人类学习具有可比性。其次,我们提出一种新颖的、专为从连续视频中学习而设计的自监督图像预训练方法。现有方法通常调整基于图像的预训练方法以纳入更多帧。相反,我们主张一种“通过跟踪来学习识别”的方法。我们的方法称为 DoRA,利用 transformer 交叉注意力以端到端方式随时间发现并跟踪(Discover and tRAck)物体。我们从跟踪结果中导出多个视图,并将其用于经典的自监督蒸馏损失。使用我们的新方法,单个 Walking Tours 视频在多个图像与视频下游任务中惊人地成为 ImageNet 的有力竞争者。

关键词

引用

@article{arxiv.2310.08584,
  title  = {Is ImageNet worth 1 video? Learning strong image encoders from 1 long unlabelled video},
  author = {Shashanka Venkataramanan and Mamshad Nayeem Rizve and João Carreira and Yuki M. Asano and Yannis Avrithis},
  journal= {arXiv preprint arXiv:2310.08584},
  year   = {2024}
}

备注

Accepted to ICLR 2024 (Best paper honorable mention). Project Page: https://shashankvkt.github.io/dora