ReferDINO-Plus:面向 CVPR 2025 第四届 PVUW MeViS 挑战的第二解
计算机视觉与模式识别
2025-05-30 v2
摘要
指涉视频对象分割(RVOS)旨在基于文本描述对视频中的目标对象进行分割。由于其在视频编辑和人机交互方面的广泛应用前景,该任务正受到计算机视觉领域的日益关注。最近,ReferDINO 通过适应来自预训练基础图像模型的面向对象的视觉语言知识,展示了在该任务中取得的有前景的性能。在本报告中,我们进一步增强了其能力,融合了 SAM2 在掩码质量和对象一致性方面的优势。此外,为有效平衡单对象和多对象情景下的性能,我们引入一种条件掩码融合策略,以适应性地融合 ReferDINO 和 SAM2 的掩码。我们的解决方案称为 ReferDINO-Plus,在 MeViS 测试集上取得 60.43 的成绩,位列 CVPR 2025 MeViS PVUW 挑战第二名。代码已公开:https://github.com/iSEE-Laboratory/ReferDINO-Plus。
引用
@article{arxiv.2503.23509,
title = {ReferDINO-Plus: 2nd Solution for 4th PVUW MeViS Challenge at CVPR 2025},
author = {Tianming Liang and Haichao Jiang and Wei-Shi Zheng and Jian-Fang Hu},
journal= {arXiv preprint arXiv:2503.23509},
year = {2025}
}