通过文本监督的弱监督指涉视频对象分割
计算机视觉与模式识别
2026-04-22 v2
摘要
指涉视频对象分割(Referring Video Object Segmentation, RVOS)旨在通过文本表达式对视频中的目标实例进行分割。传统方法主要采用监督学习,需耗费昂贵的像素级掩码标注。为解决此问题,近期提出了弱监督RVOS方法,用边界框或点代替掩码标注,但仍需大量人力成本。本文设计了一种新型弱监督RVOS方法,称为WSRVOS,仅使用文本表达式进行训练。给定输入视频和指涉表达式后,我们首先设计了对比式指涉表达式增强方案,利用多模态大语言模型的captioning能力生成正负表达式。随后提取输入视频与生成表达式的视觉与语言特征,进行双向视觉语言特征选择与交互,以实现细粒度的多模态对齐。进而提出基于实例的表达式分类方案,以区分正负表达式。同时,我们引入正预测融合策略生成高质量伪掩码,作为模型的额外监督。最后,我们设计了时间段排序约束,要求相邻帧的掩码预测重叠度符合特定顺序。在A2D Sentences、J-HMDB Sentences、Ref-YouTube-VOS和Ref-DAVIS17等四个公开RVOS数据集上进行大量实验,证明了我们方法的优越性。代码已公开于https://github.com/viscom-tongji/WSRVOS。
引用
@article{arxiv.2604.17797,
title = {Weakly-Supervised Referring Video Object Segmentation through Text Supervision},
author = {Miaojing Shi and Jun Huang and Zijie Yue and Hanli Wang},
journal= {arXiv preprint arXiv:2604.17797},
year = {2026}
}
备注
Accepted by CVPR 2026 Findings