CamSAM2:在伪装视频中精准分割任何物体
计算机视觉与模式识别
2025-11-18 v3 人工智能
摘要
视频伪装物体分割 (VCOS) 旨在分割与周围环境无缝融合的伪装物体,是一项具有各种现实世界应用的基础视觉任务。随着 SAM2 的发布,视频分割取得了显著进展。然而,SAM2 分割伪装视频的能力并非最优,尤其是在给定点提示和框提示等简单提示时。为了解决这个问题,我们提出了 Camouflaged SAM2 (CamSAM2),它在不修改 SAM2 参数的情况下增强了 SAM2 处理伪装场景的能力。具体而言,我们引入了去伪装令牌 (decamouflaged token),为 VCOS 提供特征调整的灵活性。为了充分利用当前帧和先前帧的细粒度高分辨率特征,我们分别提出了隐式物体感知融合 (IOF) 和显式物体感知融合 (EOF) 模块。引入了物体原型生成 (OPG),以利用来自先前帧的高质量特征来抽象和记忆包含丰富信息的物体原型。进行了大量实验以验证我们方法的有效性。虽然 CamSAM2 仅向 SAM2 添加了可忽略的可学习参数,但它在三个 VCOS 数据集上大幅优于 SAM2,尤其是在以 Hiera-T 为骨干网络的情况下,在 MoCA-Mask 上使用点击提示获得了 12.2 mDice 的增益,在 SUN-SEG-Hard 上使用掩码提示获得了 19.6 mDice 的增益。代码可在 https://github.com/zhoustan/CamSAM2 获取。
引用
@article{arxiv.2503.19730,
title = {CamSAM2: Segment Anything Accurately in Camouflaged Videos},
author = {Yuli Zhou and Yawei Li and Yuqian Fu and Luca Benini and Ender Konukoglu and Guolei Sun},
journal= {arXiv preprint arXiv:2503.19730},
year = {2025}
}