Point-VOS:推进视频目标分割的点标注范式
计算机视觉与模式识别
2024-06-11 v2
摘要
当前最先进的视频目标分割(VOS)方法在训练和测试阶段均依赖于密集的逐目标掩码标注。这需要耗时且昂贵的视频标注机制。我们提出了一种新颖的 Point-VOS 任务,采用时空稀疏的点标注方案,大幅减少了标注工作量。我们将该标注方案应用于两个带有文本描述的大规模视频数据集,在 32K 个视频中的 133K 个目标上标注了超过 19M 个点。基于我们的标注,我们提出了一个新的 Point-VOS 基准,以及相应的基于点的训练机制,并以此建立了强大的基线结果。我们表明,现有的 VOS 方法可以轻松调整以在训练期间利用我们的点标注,并且在使用从这些点生成的伪掩码进行训练时,能够取得接近全监督性能的结果。此外,我们展示了我们的数据可用于改进连接视觉与语言的模型,并在视频叙事定位(VNG)任务上对其进行了评估。我们将在 https://pointvos.github.io 公开我们的代码和标注。
引用
@article{arxiv.2402.05917,
title = {Point-VOS: Pointing Up Video Object Segmentation},
author = {Idil Esen Zulfikar and Sabarinath Mahadevan and Paul Voigtlaender and Bastian Leibe},
journal= {arXiv preprint arXiv:2402.05917},
year = {2024}
}
备注
Accepted to CVPR2024!