增强 Sa2VA 以实现Referent视频对象分割:7th LSVOS RVOS Track的第二解
计算机视觉与模式识别
2025-09-22 v1
摘要
Referential视频对象分割(RVOS)旨在分割与给定自然语言描述相匹配的视频中所有对象,桥接视觉与语言理解之间的差距。最近的工作,如Sa2VA,结合了大型语言模型(LLM)与SAM 2,利用LLM的强大视频推理能力以指导视频分割。本文我们提出了一个训练自由的框架,显著提高了Sa2VA在RVOS任务上的性能。我们的方法引入了两个关键组件:(1)视频语言检查器,显式验证查询中描述的主体和动作是否实际出现在视频中,从而减少误报;(2)关键帧采样器,自适应选择信息丰富的帧,以更好地捕捉早期对象出现和长程时间上下文。无需任何额外训练,我们的方法在MeViS测试集上实现了64.14%的J&F分数,在ICCV 2025的7th LSVOS挑战赛RVOS轨道中获得第二名。
引用
@article{arxiv.2509.15546,
title = {Enhancing Sa2VA for Referent Video Object Segmentation: 2nd Solution for 7th LSVOS RVOS Track},
author = {Ran Hong and Feng Lu and Leilei Cao and An Yan and Youhai Jiang and Fengjie Zhu},
journal= {arXiv preprint arXiv:2509.15546},
year = {2025}
}
备注
6 pages, 2 figures