中文

视觉感知链:利用多模态大语言模型实现零样本伪装目标检测

计算机视觉与模式识别 2024-07-31 v2

摘要

本文中,我们引入了一种新颖的多模态伪装感知框架(MMCPF),旨在通过利用多模态大语言模型(MLLMs)的强大能力来处理零样本伪装目标检测(COD)。认识到当前 COD 方法固有的局限性——主要依赖需大量精确标注数据集的监督学习模型,导致泛化能力弱——我们的研究提出了一种零样本 MMCPF 以规避这些挑战。尽管 MLLMs 在广泛应用上潜力巨大,但其在 COD 中的有效性受限,且会对伪装目标产生误判。为应对此挑战,我们进一步提出称为视觉感知链(CoVP)的策略增强,通过更有效地利用语言与视觉线索,显著提升了 MLLMs 在伪装场景中的感知能力。我们在五个广泛使用的 COD 数据集(包括 CAMO、COD10K、NC4K、MoCA-Mask 与 OVCamo)上验证了 MMCPF 的有效性。实验表明,MMCPF 优于所有现有最先进的零样本 COD 方法,并与弱监督与全监督方法取得有竞争力的性能,这展示了 MMCPF 的潜力。本文的 Github 链接为 \url{https://github.com/luckybird1994/MMCPF}。

关键词

引用

@article{arxiv.2311.11273,
  title  = {Chain of Visual Perception: Harnessing Multimodal Large Language Models for Zero-shot Camouflaged Object Detection},
  author = {Lv Tang and Peng-Tao Jiang and Zhihao Shen and Hao Zhang and Jinwei Chen and Bo Li},
  journal= {arXiv preprint arXiv:2311.11273},
  year   = {2024}
}

备注

Accepted by ACMMM2024