VoCap:基于任意提示的视频对象描述与分割
计算机视觉与模式识别
2025-09-01 v1
摘要
理解视频中对象的细粒度局部掩码及详细语义属性是视频理解的基本任务。本文提出VoCap,一种灵活的视频模型,该模型接受视频及多种模态提示(文本、框或掩码),生成具有相应对象中心描述的时空掩码块。因此,我们的模型同时解决了提示式视频对象分割、指代表达分割和对象描述三个任务。由于获取该任务数据繁琐且昂贵,我们提出对现有大规模分割数据集(SAV)进行伪对象描述标注。具体方法是预处理视频的ground-truth掩码以突出感兴趣对象,并将其输入大型视觉语言模型(VLM)以生成对象描述。为确保评估公正,我们在验证集上收集了手动标注。我们称得到的数据集为SAV-Caption。我们在SAV-Caption以及其他图像和视频数据集混合训练VoCap模型。我们的模型在指代表达视频对象分割上取得最新成果,在半监督视频对象分割上表现有竞争力,并为视频对象描述建立了基准。我们的数据集将在https://github.com/google-deepmind/vocap上公开。
引用
@article{arxiv.2508.21809,
title = {VoCap: Video Object Captioning and Segmentation from Any Prompt},
author = {Jasper Uijlings and Xingyi Zhou and Xiuye Gu and Arsha Nagrani and Anurag Arnab and Alireza Fathi and David Ross and Cordelia Schmid},
journal= {arXiv preprint arXiv:2508.21809},
year = {2025}
}