ZS-VCOS:基于光流和开放词汇目标检测的零样本视频伪装目标分割
计算机视觉与模式识别
2025-07-22 v2
摘要
与传统分割任务相比,伪装目标分割面临独特挑战,主要源于伪装目标与其背景在纹理和颜色上的高度相似性。该问题的有效解决方案在害虫防治、缺陷检测和医学影像中的病变分割等关键领域具有重要意义。先前的研究主要侧重于监督或无监督预训练方法,导致零样本方法的发展严重不足。现有的零样本技术通常以自动模式使用分割一切模型(SAM),或依赖视觉-语言模型生成分割线索;然而,由于伪装目标与背景的相似性,其性能仍不令人满意。本研究探讨如何通过将 SAM-2 和 Owl-v2 等大型预训练模型与时序信息集成到一个模块化流程中来避免训练。在 MoCA-Mask 数据集上的评估表明,我们的方法取得了显著的性能提升,将 F-measure () 从 0.296 提高到 0.628,显著优于现有的零样本方法。我们的方法还超越了监督方法,将 F-measure 从 0.476 提高到 0.628。此外,在 MoCA-Filter 数据集上的评估显示,与监督迁移方法 FlowSAM 相比,成功率从 0.628 提高到 0.697。全面的消融研究进一步验证了每个组件的单独贡献。除了主要贡献外,我们还指出了先前工作中在指标和设置方面的不一致之处。代码可在 https://github.com/weathon/vcos 找到。
引用
@article{arxiv.2505.01431,
title = {ZS-VCOS: Zero-Shot Video Camouflaged Object Segmentation By Optical Flow and Open Vocabulary Object Detection},
author = {Wenqi Guo and Mohamed Shehata and Shan Du},
journal= {arXiv preprint arXiv:2505.01431},
year = {2025}
}