UVIS:无监督视频实例分割
计算机视觉与模式识别
2024-06-12 v1
摘要
视频实例分割需要在视频帧之间对每个对象进行分类、分割和跟踪。与现有依赖掩码、框或类别标签的方法不同,我们提出 UVIS(Unsupervised Video Instance Segmentation),一种新型无监督视频实例分割框架,可在没有任何视频标注或稠密标签预训练的情况下完成视频实例分割。我们的关键思想是利用自监督视觉基础模型 DINO 的稠密形状先验,以及图像描述监督的视觉语言模型 CLIP 的开集识别能力。我们的 UVIS 框架包含三个关键步骤:帧级伪标签生成、基于 Transformer 的 VIS 模型训练和基于查询的跟踪。为提高无监督 setup 下 VIS 预测质量,我们引入双存储设计,包括用于生成准确伪标签的语义存储库和用于维持对象轨迹时间一致性的跟踪存储库。我们在三个标准 VIS 基准数据集上进行评估,分别包括 YoutubeVIS-2019、YoutubeVIS-2021 和 Occluded VIS。我们的 UVIS 在 YoutubeVIS-2019 上实现 21.1 的 AP,无需任何视频标注或稠密预训练,展示了无监督 VIS 框架的潜力。
引用
@article{arxiv.2406.06908,
title = {UVIS: Unsupervised Video Instance Segmentation},
author = {Shuaiyi Huang and Saksham Suri and Kamal Gupta and Sai Saketh Rambhatla and Ser-nam Lim and Abhinav Shrivastava},
journal= {arXiv preprint arXiv:2406.06908},
year = {2024}
}
备注
CVPR2024 Workshop