中文

第 5 届 PVUW MeViS-Text 挑战赛冠军:强 MLLM 结合 SAM3 实现指代视频目标分割

计算机视觉与模式识别 2026-04-02 v1

摘要

本报告展示了我们在第 5 届 PVUW MeViS-Text 挑战赛中的获胜方案。该赛道研究基于运动中心语言表达的指代视频目标分割,模型必须联合理解外观、时间行为和对象交互。为解决该问题,我们构建了一个完全无需训练的流水线,将强多模态大语言模型与 SAM3 相结合。我们的方法包含三个阶段。第一阶段,Gemini-3.1 Pro 将每个目标事件分解为实例级定位目标,选择目标最清晰可见的帧,并生成区分性描述。第二阶段,SAM3-agent 在选定帧上生成精确的种子掩码,官方 SAM3 跟踪器将掩码传播至整个视频。第三阶段,精炼阶段使用 Qwen3.5-Plus 和行为级验证来修正模糊或语义不一致的预测。无需任务特定微调,我们的方法在 PVUW 2026 MeViS-Text 测试集上排名第一,最终得分为 0.909064,J&F 得分为 0.7897。代码可在 https://github.com/Moujuruo/MeViSv2_Track_Solution_2026 获取。

关键词

引用

@article{arxiv.2604.00404,
  title  = {The 1st Winner for 5th PVUW MeViS-Text Challenge: Strong MLLMs Meet SAM3 for Referring Video Object Segmentation},
  author = {Xusheng He and Canyang Wu and Jinrong Zhang and Weili Guan and Jianlong Wu and Liqiang Nie},
  journal= {arXiv preprint arXiv:2604.00404},
  year   = {2026}
}

备注

1st Place Solution for the 5th PVUW MeViS-Text Challenge (CVPR 2026 Workshop)