中文

训练-free 稳健交互式视频对象分割

计算机视觉与模式识别 2024-06-11 v1

摘要

交互式视频对象分割是关键视频任务,具有从视频编辑到数据标注等多种应用。然而,当前方法在跨域准确分割对象方面仍面临挑战。最近,Segment Anything Model (SAM) 引入了交互式视觉提示并在不同领域展现了惊人的性能。在本文中,我们提出一种基于SAM的训练-free提示跟踪框架,用于交互式视频对象分割 (I-PT)。虽然点跟踪能够高效捕获视频中对象的像素级信息,但点在长时间跟踪过程中倾向于不稳定,导致分割错误。针对快速且稳健的交互需求,我们联合采用稀疏点和框的跟踪,筛选出不稳定的点,同时捕获对象级信息。为更好地整合来自多次交互的参考信息,我们引入跨轮时空模块 (CRSTM),该模块能自适应地聚合来自前轮和帧的掩码特征,从而增强分割稳定性。我们的框架在包括DAVIS 2017、YouTube-VOS 2018和MOSE 2023在内的流行视频对象分割数据集上,Demonstrated robust zero-shot video segmentation results with various interaction types,在性能与交互时间之间取得良好平衡。

关键词

引用

@article{arxiv.2406.05485,
  title  = {Training-Free Robust Interactive Video Object Segmentation},
  author = {Xiaoli Wei and Zhaoqing Wang and Yandong Guo and Chunxia Zhang and Tongliang Liu and Mingming Gong},
  journal= {arXiv preprint arXiv:2406.05485},
  year   = {2024}
}