CLIP-VIS:将 CLIP 适配用于开放词汇视频实例分割
计算机视觉与模式识别
2024-10-10 v3
摘要
开放词汇视频实例分割旨在对视频中属于开放类别集的实例进行分割与跟踪。视觉-语言模型对比语言-图像预训练(CLIP)已在图像级开放词汇任务中展现出鲁棒的零样本分类能力。本文提出一种简单的编码器-解码器网络 CLIP-VIS,将 CLIP 适配用于开放词汇视频实例分割。我们的 CLIP-VIS 采用冻结的 CLIP,并引入三个模块:类别无关掩码生成、时序 topK 增强匹配和加权开放词汇分类。给定一组初始查询,类别无关掩码生成在 CLIP 预训练的图像编码器上引入像素解码器和 Transformer 解码器,以预测查询掩码及相应的目标分数和掩码 IoU 分数。然后,时序 topK 增强匹配利用 K 个最匹配帧在帧间执行查询匹配。最后,加权开放词汇分类首先采用掩码池化从 CLIP 预训练图像编码器生成查询视觉特征,其次利用目标分数和掩码 IoU 分数进行加权分类。我们的 CLIP-VIS 无需实例类别和身份标注。在多个视频实例分割数据集上进行的实验证明了所提方法的有效性,尤其对于新类别。当使用 ConvNeXt-B 作为骨干网络时,我们的 CLIP-VIS 在 LV-VIS 数据集验证集上达到 32.2% 的 AP 和 40.2% 的 APn 分数,分别比 OV2Seg 高出 11.1% 和 23.9%。我们将在 https://github.com/zwq456/CLIP-VIS.git 发布源代码和模型。
引用
@article{arxiv.2403.12455,
title = {CLIP-VIS: Adapting CLIP for Open-Vocabulary Video Instance Segmentation},
author = {Wenqi Zhu and Jiale Cao and Jin Xie and Shuangming Yang and Yanwei Pang},
journal= {arXiv preprint arXiv:2403.12455},
year = {2024}
}
备注
Accepted by IEEE TCSVT