流匹配的视频变形到掩码:指代视频分割
计算机视觉与模式识别
2026-02-27 v2
摘要
指代视频对象分割(RVOS)需要依据自然语言描述对视频中的特定对象进行分割。RVOS的核心挑战在于将抽象的语言概念锚定到特定像素集合上,并在视频复杂动态中持续进行分割。面对这一困难,先前工作常将任务分解为实用的locate-then-segment管线。然而,这种级联设计通过将语义简化为粗糙几何提示(如点)来制造信息瓶颈,且在分割过程常与初始语言 grounding 脱节的情况下难以维持时间一致性。为克服这些根本性限制,我们提出FlowRVS,一种重新概念化RVOS为条件连续流问题的新框架。这使我们能够利用预训练T2V模型的内在优势、精细的像素控制、文本-视频语义对齐以及时间一致性。我们不采用常规从噪声生成掩码或直接预测掩码的方法,而是通过学习从视频整体表示到其目标掩码的直接、语言引导的变形来重新定义任务。该单阶段生成方法在所有主要RVOS基准测试上实现了新的最高结果。具体而言,在MeViS上实现J&F为51.1(超越先前SOTA 1.6),在零样本Ref-DAVIS17上实现73.3(超越2.7),彰显了将视频理解任务建模为连续变形过程的巨大潜力。
引用
@article{arxiv.2510.06139,
title = {Deforming Videos to Masks: Flow Matching for Referring Video Segmentation},
author = {Zanyi Wang and Dengyang Jiang and Liuzhuozheng Li and Sizhe Dang and Chengzu Li and Harry Yang and Guang Dai and Mengmeng Wang and Jingdong Wang},
journal= {arXiv preprint arXiv:2510.06139},
year = {2026}
}