当 SAM2 遇见视频伪装目标分割:综合评估与适配
计算机视觉与模式识别
2025-05-13 v2 人工智能
摘要
本研究探讨了 Segment Anything Model 2 (SAM2) 在视频伪装目标分割(VCOS)这一具有挑战性的任务中的应用和性能。由于相似的颜色和纹理、恶劣的光照条件等,VCOS 涉及在视频中检测与周围环境无缝融合的目标。与正常场景中的目标相比,伪装目标更难被检测。SAM2 作为一个视频基础模型,在各种任务中展现了潜力。但其在动态伪装场景中的有效性仍有待探索。本研究对 SAM2 在 VCOS 中的能力进行了全面研究。首先,我们使用不同的模型和提示(点击、框和掩码)评估了 SAM2 在伪装视频数据集上的性能。其次,我们探索了 SAM2 与现有大型多模态语言模型(MLLMs)和 VCOS 方法的整合。第三,我们通过在视频伪装数据集上微调,专门适配了 SAM2。我们的综合实验表明,SAM2 具有在视频中检测伪装目标的出色零样本能力。我们还表明,通过专门针对 VCOS 调整 SAM2 的参数,可以进一步提高这种能力。代码可在 https://github.com/zhoustan/SAM2-VCOS 获取
引用
@article{arxiv.2409.18653,
title = {When SAM2 Meets Video Camouflaged Object Segmentation: A Comprehensive Evaluation and Adaptation},
author = {Yuli Zhou and Guolei Sun and Yawei Li and Guo-Sen Xie and Luca Benini and Ender Konukoglu},
journal= {arXiv preprint arXiv:2409.18653},
year = {2025}
}
备注
Technical report. Accepted by Visual Intelligence. Code is released at https://github.com/zhoustan/SAM2-VCOS