中文

Point-VOS:推进视频目标分割的点标注范式

计算机视觉与模式识别 2024-06-11 v2

摘要

当前最先进的视频目标分割(VOS)方法在训练和测试阶段均依赖于密集的逐目标掩码标注。这需要耗时且昂贵的视频标注机制。我们提出了一种新颖的 Point-VOS 任务,采用时空稀疏的点标注方案,大幅减少了标注工作量。我们将该标注方案应用于两个带有文本描述的大规模视频数据集,在 32K 个视频中的 133K 个目标上标注了超过 19M 个点。基于我们的标注,我们提出了一个新的 Point-VOS 基准,以及相应的基于点的训练机制,并以此建立了强大的基线结果。我们表明,现有的 VOS 方法可以轻松调整以在训练期间利用我们的点标注,并且在使用从这些点生成的伪掩码进行训练时,能够取得接近全监督性能的结果。此外,我们展示了我们的数据可用于改进连接视觉与语言的模型,并在视频叙事定位(VNG)任务上对其进行了评估。我们将在 https://pointvos.github.io 公开我们的代码和标注。

关键词

引用

@article{arxiv.2402.05917,
  title  = {Point-VOS: Pointing Up Video Object Segmentation},
  author = {Idil Esen Zulfikar and Sabarinath Mahadevan and Paul Voigtlaender and Bastian Leibe},
  journal= {arXiv preprint arXiv:2402.05917},
  year   = {2024}
}

备注

Accepted to CVPR2024!