中文

4th PVUW MeViS 3rd Place Report: Sa2VA

计算机视觉与模式识别 2025-04-02 v1

摘要

指涉视频对象分割(RVOS)是一项具有挑战性的任务,需要模型根据语言描述对视频中的目标对象进行分割。MeViS是一个近期提出的数据集,包含目标对象的运动表达式,导致其成为与现有RVOS基准相比更具挑战性的基准。另一方面,针对指涉表达任务,一种新趋势是采用多模态大型语言模型(MLLM)以实现更好的图像和文本对齐。在本报告中,我们展示,通过对更强大的MLLM在测试时间推理方法进行简单修改,即可在MeViS上获得更好的结果。具体而言,我们采用了最近的方法Sa2VA,这是一个用于同时理解图像和视频的统一模型。通过扩大关键帧的范围,且无需进一步训练,即可在第4届PVUW工作坊中获得第三名成绩。

关键词

引用

@article{arxiv.2504.00476,
  title  = {4th PVUW MeViS 3rd Place Report: Sa2VA},
  author = {Haobo Yuan and Tao Zhang and Xiangtai Li and Lu Qi and Zilong Huang and Shilin Xu and Jiashi Feng and Ming-Hsuan Yang},
  journal= {arXiv preprint arXiv:2504.00476},
  year   = {2025}
}

备注

Technical Report, 4 pages, Code: https://github.com/magic-research/Sa2VA