中文

CamoSAM2:基于运动-外观诱导的自细化提示用于视频伪装物体检测

计算机视觉与模式识别 2025-04-02 v1

摘要

Segment Anything Model 2(SAM2)作为一种以提示为导引的视频基础模型,在视频对象分割方面取得了显著的性能,引起了社区的广泛关注。由于伪装物体与其周围环境高度相似,即使肉眼也难以区分,SAM2 在实际场景中应用于自动化分割面临伪装感知和可靠提示生成等挑战。为此,我们提出了 CamoSAM2,一种运动-外观提示诱导器(MAPI)和细化框架,用于自动生成和细化 SAM2 的提示,从而在 VCOD 任务中实现高质量的自动检测和分割。首先,我们引入一个提示诱导器,同时整合运动和外观线索以检测伪装物体,相比现有方法提供更精确的初始预测。随后,我们提出一种针对 SAM2 的视频基适应性多提示细化(AMPR)策略,旨在缓解初始粗糙掩码中的提示错误,并进一步生成良好提示。具体而言,我们引入了一个三步骤过程,用于通过伪装物体确定、关键提示帧选择和多提示生成来创建可靠提示。在两个基准数据集上进行的大量实验表明,我们提出的模型 CamoSAM2 显著优于现有的前沿方法,在 mIoU 指标上提升了 8.0% 和 10.1%。此外,我们的方法在当前 VCOD 模型中实现了最快的推理速度。

关键词

引用

@article{arxiv.2504.00375,
  title  = {CamoSAM2: Motion-Appearance Induced Auto-Refining Prompts for Video Camouflaged Object Detection},
  author = {Xin Zhang and Keren Fu and Qijun Zhao},
  journal= {arXiv preprint arXiv:2504.00375},
  year   = {2025}
}

备注

10 pages, 5 figures,