基于级联视觉语言模型的开放词汇伪装目标分割
计算机视觉与模式识别
2026-03-10 v2
摘要
开放词汇伪装目标分割 (Open-Vocabulary Camouflaged Object Segmentation, OVCOS) 旨在从任意类别中分割和分类伪装目标,由于视觉模糊和未见类别,呈现独特挑战。近期方法通常采用两阶段范式:首先分割目标,然后使用视觉语言模型 (Vision Language Models, VLMs) 对分割区域进行分类。然而,这些方法 (1) 因 VLMs 全图训练与裁剪区域推理之间的领域差距而受限,(2) 依赖针对清晰边界目标优化的通用分割模型,对于伪装目标效果有限。在本文中,我们引入一种新型的 VLM 指导级联框架,以解决 OVCOS 中的上述问题。对于分割任务,我们利用由 VLM 提供的特征作为显式提示,引导分割感知模型 (SAM),有效地将注意力导向伪装区域,从而显著提高局部定位精度。对于分类任务,我们避免硬性裁剪引入的领域差距。我们将分割输出视为通过 alpha 通道表示的软空间先验,该先验保留完整图像上下文,同时提供精确的空间引导,从而实现对伪装目标更准确且具有上下文感知的分类。同一 VLM 在分割和分类中共享使用,以确保效率和语义一致性。在 OVCOS 和常规伪装目标分割基准测试上进行的大量实验表明,我们方法的明显优势凸显了充分利用 VLM 语义进行伪装目标分割和分类的有效性。
引用
@article{arxiv.2506.19300,
title = {Open-Vocabulary Camouflaged Object Segmentation with Cascaded Vision Language Models},
author = {Kai Zhao and Wubang Yuan and Zheng Wang and Guanyi Li and Xiaoqiang Zhu and Deng-ping Fan and Dan Zeng},
journal= {arXiv preprint arXiv:2506.19300},
year = {2026}
}
备注
Accepted to Computational Visual Media (CVMJ) 2026