基于大模型的指代 camouflaged 目标检测
计算机视觉与模式识别
2023-11-30 v1
摘要
指代 camouflaged 目标检测 (Ref-COD) 是近期提出的一个问题,旨在分割出与文本或视觉参考相匹配的指定 camouflaged 目标。该任务涉及两大主要挑战:COD 领域特定感知与多模态参考-图像对齐。我们的动机是充分利用近期多模态大语言模型 (MLLM) 的语义智能与内在知识,以类人的方式分解这一复杂任务。由于语言具有高度凝练与归纳性,语言表达是人类知识学习的主要媒介,且知识信息的传递遵循从简到繁的多层级递进。本文中,我们提出一种基于大模型的、多级知识引导的多模态 Ref-COD 方法,称为 MLKG,其中来自 MLLM 的多级知识描述被组织起来引导分割大模型逐步感知 camouflaged 目标与 camouflaged 场景,同时深度对齐文本参考与 camouflaged 图像。据我们所知,我们的贡献主要包括:(1) 首次研究 MLLM 知识用于 Ref-COD 与 COD。(2) 我们首次提出通过融合 MLLM 知识将 Ref-COD 分解为感知目标与场景两个主要视角,并贡献了一种多级知识引导方法。(3) 我们的方法在 Ref-COD 基准上达到当前最优 (SOTA),优于众多强竞争对手。此外,得益于注入的丰富知识,它在单模态 COD 数据集上展现出零样本泛化能力。我们将很快发布代码。
引用
@article{arxiv.2311.17122,
title = {Large Model Based Referring Camouflaged Object Detection},
author = {Shupeng Cheng and Ge-Peng Ji and Pengda Qin and Deng-Ping Fan and Bowen Zhou and Peng Xu},
journal= {arXiv preprint arXiv:2311.17122},
year = {2023}
}