中文

ReferDINO-Plus:面向 CVPR 2025 第四届 PVUW MeViS 挑战的第二解

计算机视觉与模式识别 2025-05-30 v2

摘要

指涉视频对象分割(RVOS)旨在基于文本描述对视频中的目标对象进行分割。由于其在视频编辑和人机交互方面的广泛应用前景,该任务正受到计算机视觉领域的日益关注。最近,ReferDINO 通过适应来自预训练基础图像模型的面向对象的视觉语言知识,展示了在该任务中取得的有前景的性能。在本报告中,我们进一步增强了其能力,融合了 SAM2 在掩码质量和对象一致性方面的优势。此外,为有效平衡单对象和多对象情景下的性能,我们引入一种条件掩码融合策略,以适应性地融合 ReferDINO 和 SAM2 的掩码。我们的解决方案称为 ReferDINO-Plus,在 MeViS 测试集上取得 60.43 J&F\mathcal{J}\&\mathcal{F} 的成绩,位列 CVPR 2025 MeViS PVUW 挑战第二名。代码已公开:https://github.com/iSEE-Laboratory/ReferDINO-Plus。

关键词

引用

@article{arxiv.2503.23509,
  title  = {ReferDINO-Plus: 2nd Solution for 4th PVUW MeViS Challenge at CVPR 2025},
  author = {Tianming Liang and Haichao Jiang and Wei-Shi Zheng and Jian-Fang Hu},
  journal= {arXiv preprint arXiv:2503.23509},
  year   = {2025}
}