从弱标注中学习指代视频对象分割
计算机视觉与模式识别
2023-12-18 v2
摘要
指代视频对象分割(RVOS)旨在基于描述对象的语句在全部视频帧中分割目标对象。尽管现有RVOS方法已取得显著性能,它们依赖于密集标注数据集,而此类数据集获取昂贵且耗时。本文提出一种新的标注方案,将标注工作量降低8倍,同时为RVOS提供充分监督。我们的方案仅要求对象首次出现帧的掩码以及其余帧的边界框。基于该方案,我们开发了一种有效利用弱标注的新颖RVOS方法。具体而言,我们构建了简单而有效的基线模型SimRVOS用于弱标注RVOS。随后,我们设计了一个跨帧分割模块,利用来自一帧的语言引导动态滤波器在其他帧中分割目标对象,以充分利用有价值的掩码标注与边界框。最后,我们开发了双层对比学习方法,以弱标注增强模型的像素级判别表示。我们进行了大量实验表明,我们的方法在无需密集掩码标注的情况下取得了与全监督方法相当甚至更优的性能。
引用
@article{arxiv.2308.02162,
title = {Learning Referring Video Object Segmentation from Weak Annotation},
author = {Wangbo Zhao and Kepan Nan and Songyang Zhang and Kai Chen and Dahua Lin and Yang You},
journal= {arXiv preprint arXiv:2308.02162},
year = {2023}
}