中文

Sa2VA-i:通过一致的训练与推理改进 Sa2VA 结果

计算机视觉与模式识别 2025-11-19 v2

摘要

Sa2VA 是一种用于图像和视频中语言引导密集定位的最新模型,在多个分割基准上取得了 state-of-the-art 的结果,并已得到广泛应用。然而,我们发现 Sa2VA 在 referring video object segmentation 任务中未能发挥其全部潜力。我们确认训练与推理过程之间的不一致是阻碍其性能的关键因素。为缓解此问题,我们提出了 Sa2VA 的改进版本 Sa2VA-i,修正了这些问题并改善了结果。事实上,Sa2VA-i 在多个视频基准上确立了新的 state of the art,在使用相同 Sa2VA 检查点的情况下,在 MeViS 上实现了高达 +11.6 J&F 的提升,在 Ref-YT-VOS 上提升 +1.4,在 Ref-DAVIS 上提升 +3.3,在 ReVOS 上提升 +4.1。通过我们的修复,Sa2VA-i-1B 模型在 MeViS 基准上的表现甚至与原始的 Sa2VA-26B 模型相当。我们希望这项工作能展示看似微不足道的实现细节的重要性,并为 referring video segmentation 领域提供有价值的见解。我们在 https://github.com/kumuji/sa2va-i 提供了代码和更新后的模型。

关键词

引用

@article{arxiv.2509.19082,
  title  = {Sa2VA-i: Improving Sa2VA Results with Consistent Training and Inference},
  author = {Alexey Nekrasov and Ali Athar and Daan de Geus and Alexander Hermans and Bastian Leibe},
  journal= {arXiv preprint arXiv:2509.19082},
  year   = {2025}
}