中文

多模态数据提升隐蔽目标分割性能: MultiCOS 框架

计算机视觉与模式识别 2025-05-20 v2

摘要

隐蔽目标分割 (COS) 仍具有挑战性,因为隐蔽目标仅与背景之间存在细微的视觉差异,单模态 RGB 方法提供的线索有限,导致研究人员探索多模态数据以提高分割精度。在本 work 中,我们提出 MultiCOS,一个有效利用多样化数据模态以提高分割性能的 novel 框架。MultiCOS 包含两个模块: Bi-space Fusion Segmentor (BFSer),其采用状态空间和潜在空间融合机制在共享表示中整合跨模态特征,并采用融合反馈机制以细化特定情境的特征;以及 Cross-modal Knowledge Learner (CKLer),其利用外部多模态数据集生成伪模态输入并建立跨模态语义关联,将知识传递给 COS 模型以应对真实多模态对缺失的情况。当真实的多模态 COS 数据不可用时,CKLer 仅使用非 COS 多模态来源即可获得额外的分割收益。在标准 COS 基准测试上的实验表明,BFSer 在真实和伪模态数据上均优于现有多模态基线方法。代码将在 GitHub 上发布。

关键词

引用

@article{arxiv.2502.14471,
  title  = {Integrating Extra Modality Helps Segmentor Find Camouflaged Objects Well},
  author = {Chengyu Fang and Chunming He and Longxiang Tang and Yuelin Zhang and Chenyang Zhu and Yuqi Shen and Chubin Chen and Guoxia Xu and Xiu Li},
  journal= {arXiv preprint arXiv:2502.14471},
  year   = {2025}
}

备注

18 pages, 8 figures, 14 tables