中文

AgentRVOS:基于对象轨迹推理的零样本指涉视频对象分割

计算机视觉与模式识别 2026-03-25 v1

摘要

指涉视频对象分割(RVOS)旨在给定自然语言查询,对视频中的目标对象进行分割。训练-free方法遵循常见管道:MLLM选择关键帧,在这些帧中对被指对象进行定位,然后调用视频分割模型 propagates 结果。虽然直观,但这种设计要求MLLM在获取任何对象级证据之前就进行时间决策,限制了推理质量和时空覆盖范围。为克服这一问题,我们提出AgentRVOS,一种基于SAM3和MLLM互补优势构建的训练-free智能体管道。给定查询派生的概念,SAM3通过生成的掩码轨迹在整个时空范围内提供可靠的感知。随后,MLLM通过查询 grounding 推理 over 该对象级证据,不断修剪,同时借助SAM3的时间存在信息进行引导。大量实验表明,AgentRVOS在多个基准测试上实现了训练-free方法的SOTA性能,不同MLLM backbone的结果表现稳定一致。我们的项目页面地址:https://cvlab-kaist.github.io/AgentRVOS/。

关键词

引用

@article{arxiv.2603.23489,
  title  = {AgentRVOS: Reasoning over Object Tracks for Zero-Shot Referring Video Object Segmentation},
  author = {Woojeong Jin and Jaeho Lee and Heeseong Shin and Seungho Jang and Junhwan Heo and Seungryong Kim},
  journal= {arXiv preprint arXiv:2603.23489},
  year   = {2026}
}