将实例布朗桥作为文本用于开放词汇视频实例分割
计算机视觉与模式识别
2024-01-19 v1
摘要
利用任意类别文本来在时间上定位物体是开放词汇视频实例分割(VIS)的主要目标。由于视频数据词汇量不足,以往的方法利用图像 - 文本预训练模型,通过单独对齐每一帧和类别文本来识别物体实例,却忽略了帧之间的相关性。因此,这种分离破坏了视频中实例的运动上下文,导致视频与文本之间的对齐效果不佳。为解决这一问题,我们提出将帧级实例表示链接为布朗桥(Brownian Bridge),以建模实例动态,并将桥级实例表示与类别文本对齐,从而实现更精确的开放词汇 VIS(BriVIS)。具体而言,我们的系统基于一个冻结的视频分割器生成帧级实例查询,并设计了时间实例重采样器(TIR)以从帧查询中生成具有时间上下文的查询。为了使实例查询遵循布朗桥并完成与类别文本的对齐,我们设计了桥 - 文本对齐(BTA)模块,通过对比目标学习实例的判别性桥级表示。以 MinVIS 作为基础视频分割器,BriVIS 以明显优势超越了开放词汇 SOTA(OV2Seg)。例如,在具有挑战性的大词汇量 VIS 数据集(BURST)上,BriVIS 达到了 7.43 mAP,相比 OV2Seg(4.97 mAP)提升了 49.49%。
引用
@article{arxiv.2401.09732,
title = {Instance Brownian Bridge as Texts for Open-vocabulary Video Instance Segmentation},
author = {Zesen Cheng and Kehan Li and Hao Li and Peng Jin and Chang Liu and Xiawu Zheng and Rongrong Ji and Jie Chen},
journal= {arXiv preprint arXiv:2401.09732},
year = {2024}
}