放宽 SAM 中图像特定提示的要求:用于分割伪装物体的单一通用提示
计算机视觉与模式识别
2023-12-20 v3
摘要
伪装物体检测(COD)方法严重依赖像素级标注的数据集。弱监督 COD(WSCOD)方法使用涂鸦或点等稀疏标注来减少标注工作量,但这可能导致准确性下降。Segment Anything Model(SAM)在使用点等稀疏提示时展现出卓越的分割能力。然而,手动提示并不总是可行的,因为在实际应用中可能无法获取。此外,它仅提供定位信息而非语义信息,这在本质上会导致对目标的解释产生歧义。在这项工作中,我们旨在消除对手动提示的需求。核心思想是采用跨模态思维链提示(CCTP),利用通用文本提示给出的语义信息来推理视觉提示。为此,我们引入了一种称为可泛化 SAM(GenSAM)的测试时逐实例自适应机制,以自动生成并优化 WSCOD 的通用任务提示的视觉提示。具体而言,CCTP 利用视觉-语言模型将单一通用文本提示映射为图像特定的共识前景和背景热力图,从而获取可靠的视觉提示。此外,为了在测试时自适应视觉提示,我们进一步提出了渐进式掩码生成(PMG),以迭代地重新加权输入图像,引导模型以由粗到细的方式聚焦于目标。关键的是,所有网络参数都是固定的,避免了额外训练的需要。实验证明了 GenSAM 的优越性。在三个基准上的实验表明,GenSAM 优于点监督方法,并取得了与涂鸦监督方法相当的结果,且仅依赖通用任务描述作为提示。我们的代码位于:https://lwpyh.github.io/GenSAM/。
引用
@article{arxiv.2312.07374,
title = {Relax Image-Specific Prompt Requirement in SAM: A Single Generic Prompt for Segmenting Camouflaged Objects},
author = {Jian Hu and Jiayi Lin and Weitong Cai and Shaogang Gong},
journal= {arXiv preprint arXiv:2312.07374},
year = {2023}
}
备注
Accepted by AAAI2024