第 7 届 LSVOS RVOS 挑战赛解:SaSaSa2VA
计算机视觉与模式识别
2025-10-21 v2 人工智能
摘要
指导自然语言表达式对视频进行对象分割和跟踪的referred video object segmentation(RVOS)需要对 appearance 和 motion 进行细粒度理解。基于将多模态大语言模型(MLLM)与视频分割模型 SAM2 结合的 Sa2VA,我们识别到了限制分割性能的两个关键瓶颈:稀疏帧采样和依赖于单个 [SEG] token 处理整个视频。我们提出了分段增强和选择性平均化的 Sa2VA(Segmentation Augmented and Selective Averaged Sa2VA,SaSaSa2VA)以解决这些问题。在第 7 届 LSVOS 挑战赛(RVOS 轨道)上,SaSaSa2VA 实现了 的 67.45,位列第一,超过了第二名的 2.80 分。这一结果和消融实验表明,有效的分割增强和测试时集成显著提升了以 grounded MLLM 为 RVOS 的表现。代码已发布在 Sa2VA 仓库:https://github.com/bytedance/Sa2VA。
引用
@article{arxiv.2509.16972,
title = {The 1st Solution for 7th LSVOS RVOS Track: SaSaSa2VA},
author = {Quanzhu Niu and Dengxian Gong and Shihao Chen and Tao Zhang and Yikang Zhou and Haobo Yuan and Lu Qi and Xiangtai Li and Shunping Ji},
journal= {arXiv preprint arXiv:2509.16972},
year = {2025}
}
备注
The 1st place report of 7th LSVOS challenge RVOS track in ICCV 2025. The code is released in Sa2VA repository: https://github.com/bytedance/Sa2VA