SVAC:只需规模化,才能实现指代视频对象分割
计算机视觉与模式识别
2025-09-30 v1
摘要
指代视频对象分割(RVOS)旨在基于自然语言描述对视频序列中的目标对象进行分割。尽管近期在多模态大语言模型(MLLMs)的进展提升了 RVOS 性能,但仍面临若干挑战,包括对 MLLMs 先验知识的利用不足、长时段视频的计算和内存成本过高,以及对复杂时序动态的处理不充分。本文我们提出了 SVAC,一个统一模型,通过放大输入帧数和分割标记来增强视频-语言交互和分割精度,以提升 RVOS 性能。为解决计算挑战,SVAC 引入基于锚框的时空压缩模块(ASTC),在保持关键时空结构的前提下压缩视觉标记。此外,引入特定裁剪的分配策略(CSA),以更好地处理跨视频片段中动态对象的行为。实验结果表明,SVAC 在多个 RVOS 数据集上实现了状态的最佳性能,同时保持竞争的效率。我们的代码已公开于 https://github.com/lizhang1998/SVAC。
引用
@article{arxiv.2509.24109,
title = {SVAC: Scaling Is All You Need For Referring Video Object Segmentation},
author = {Li Zhang and Haoxiang Gao and Zhihao Zhang and Luoxiao Huang and Tao Zhang},
journal= {arXiv preprint arXiv:2509.24109},
year = {2025}
}
备注
This paper is accepted to BMVC 2025