中文

增强 Sa2VA 以实现Referent视频对象分割:7th LSVOS RVOS Track的第二解

计算机视觉与模式识别 2025-09-22 v1

摘要

Referential视频对象分割(RVOS)旨在分割与给定自然语言描述相匹配的视频中所有对象,桥接视觉与语言理解之间的差距。最近的工作,如Sa2VA,结合了大型语言模型(LLM)与SAM 2,利用LLM的强大视频推理能力以指导视频分割。本文我们提出了一个训练自由的框架,显著提高了Sa2VA在RVOS任务上的性能。我们的方法引入了两个关键组件:(1)视频语言检查器,显式验证查询中描述的主体和动作是否实际出现在视频中,从而减少误报;(2)关键帧采样器,自适应选择信息丰富的帧,以更好地捕捉早期对象出现和长程时间上下文。无需任何额外训练,我们的方法在MeViS测试集上实现了64.14%的J&F分数,在ICCV 2025的7th LSVOS挑战赛RVOS轨道中获得第二名。

关键词

引用

@article{arxiv.2509.15546,
  title  = {Enhancing Sa2VA for Referent Video Object Segmentation: 2nd Solution for 7th LSVOS RVOS Track},
  author = {Ran Hong and Feng Lu and Leilei Cao and An Yan and Youhai Jiang and Fengjie Zhu},
  journal= {arXiv preprint arXiv:2509.15546},
  year   = {2025}
}

备注

6 pages, 2 figures