中文

先识别,后跟踪:解耦指称视频目标分割中的识别与传播

计算机视觉与模式识别 2025-07-29 v2

摘要

指称视频目标分割旨在使用自然语言提示对视频中的目标对象进行分割和跟踪。现有方法通常以高度纠缠的方式融合视觉和文本特征,共同处理多模态信息以生成逐帧掩码。然而,这种方法在目标识别模糊时经常遇到困难,特别是在存在多个相似对象的场景中,并且无法确保跨帧的掩码传播一致性。为了解决这些局限性,我们引入了FindTrack,一个高效的解耦框架,将目标识别与掩码传播分离。FindTrack首先通过平衡分割置信度和视觉-文本对齐来自适应地选择关键帧,为目标对象建立稳健的参考。然后,专门的传播模块利用该参考在整个视频中跟踪和分割该对象。通过解耦这些过程,FindTrack有效减少了目标关联中的模糊性并增强了分割一致性。FindTrack在公共基准测试中显著优于所有现有方法,展示了其优越性。

关键词

引用

@article{arxiv.2503.03492,
  title  = {Find First, Track Next: Decoupling Identification and Propagation in Referring Video Object Segmentation},
  author = {Suhwan Cho and Seunghoon Lee and Minhyeok Lee and Jungho Lee and Sangyoun Lee},
  journal= {arXiv preprint arXiv:2503.03492},
  year   = {2025}
}

备注

ICCVW 2025