中文

任意模态显著物体检测的模态提示

计算机视觉与模式识别 2024-05-07 v1

摘要

本文深入探讨了任意模态显著物体检测(AM SOD)任务,旨在从任意模态(如 RGB 图像、RGB-D 图像和 RGB-D-T 图像)中检测显著物体。将提出一种新颖的模态自适应 Transformer(MAT),以调查 AM SOD 的两个基本挑战:由不同模态类型导致的更多样化的模态差异,这些差异需要被处理;以及由不确定输入中模态数量引起的动态融合设计。具体而言,受提示学习在通过学习一些提示来将预训练模型的分布对齐到下游任务特征的能力启发,MAT 将首先提出一种模态自适应特征提取器(MAFE),通过为每种模态引入模态提示来解决多样化的模态差异。在训练阶段,将进一步设计一种新的模态翻译紧致(MTC)损失,以辅助 MAFE 学习这些模态可区分的模态提示。因此,在测试阶段,MAFE 可以利用所学的模态提示根据输入模态的特征自适应地调整其特征空间,从而能够提取判别性的单模态特征。随后,MAFE 将提出一种通道级和空间级融合混合(CSFH)策略,以满足动态融合的需求。为此,CSFH 为通道级动态融合模块(CDFM)和一种新颖的空间级动态融合模块(SDFM)各提供一个,以融合来自不同模态数量的单模态特征,同时有效地分别捕获跨模态的互补语义和细节信息。此外,CSFH 将根据其特征为更有效地利用互补信息的需求,仔细地将 CDFM 和 SDFM 对齐到不同层次的单模态特征上。

关键词

引用

@article{arxiv.2405.03351,
  title  = {Modality Prompts for Arbitrary Modality Salient Object Detection},
  author = {Nianchang Huang and Yang Yang and Qiang Zhang and Jungong Han and Jin Huang},
  journal= {arXiv preprint arXiv:2405.03351},
  year   = {2024}
}

备注

13 pages, 7 Figures, 3 Tables