中文

Video OWL-ViT:视频中时间一致的开放世界定位

计算机视觉与模式识别 2023-08-23 v1 人工智能 机器学习

摘要

我们提出了一种架构和训练方案,将预训练的开放世界图像模型适配到视频中的定位任务。理解开放的视觉世界(不受固定标签空间约束)对许多现实世界的视觉任务至关重要。在大规模图像-文本数据集上的对比预训练最近在图像级任务上带来了显著改进。对于涉及目标定位的更结构化任务,应用预训练模型更具挑战性。对于视频任务尤其如此,因为特定任务的数据有限。我们通过构建在 OWL-ViT 开放词汇检测模型之上并将其适配到视频(通过添加 transformer 解码器)来展示开放世界模型的成功迁移。该解码器通过使用一帧的输出 token 作为下一帧的目标查询,递归地随时间传播目标表示。我们的模型在视频数据上是端到端可训练的,并且与检测后跟踪基线相比具有更好的时间一致性,同时保留了骨干检测器的开放世界能力。我们在具有挑战性的 TAO-OW 基准上评估了我们的模型,并证明从大规模图像-文本预训练中学到的开放世界能力可以成功迁移到跨多样视频的开放世界定位。

关键词

引用

@article{arxiv.2308.11093,
  title  = {Video OWL-ViT: Temporally-consistent open-world localization in video},
  author = {Georg Heigold and Matthias Minderer and Alexey Gritsenko and Alex Bewley and Daniel Keysers and Mario Lučić and Fisher Yu and Thomas Kipf},
  journal= {arXiv preprint arXiv:2308.11093},
  year   = {2023}
}

备注

ICCV 2023