时序提示至关重要:重新思考指代视频对象分割
计算机视觉与模式识别
2025-10-09 v1
摘要
指代视频对象分割(Referring Video Object Segmentation, RVOS)旨在分割由查询句子指代的视频中的对象。大多数现有方法需要使用稠密掩码注释进行端到端训练,这既计算密集又难以扩展。本文重新思考了RVOS问题,旨在探讨该任务的关键所在。基于现有基础分割模型,我们将RVOS任务分解为指代、视频和分割三个因素,提出一种时序提示生成与选择(Temporal Prompt Generation and Selection, Tenet)框架,以解决指代和视频因素,同时将分割问题留给基础模型。为高效地将基于图像的基础分割模型适应指代视频对象分割,我们利用即插即用的目标检测器和跟踪器生成与指代句子相关的时序提示。虽然可以产生高质量的时序提示,但无法仅凭置信度分数轻松识别它们。为解决此问题,我们提出了提示偏好学习(Prompt Preference Learning)来评估所产生的时序提示质量。通过对这些提示指示基于图像的基础分割模型,我们即可为指代对象生成高质量的掩码,实现对指代视频对象分割的高效模型适应。实验在RVOS基准测试上表明,Tenet框架的有效性。
引用
@article{arxiv.2510.07319,
title = {Temporal Prompting Matters: Rethinking Referring Video Object Segmentation},
author = {Ci-Siang Lin and Min-Hung Chen and I-Jieh Liu and Chien-Yi Wang and Sifei Liu and Yu-Chiang Frank Wang},
journal= {arXiv preprint arXiv:2510.07319},
year = {2025}
}