中文

学习自适应融合库用于多模态显著目标检测

计算机视觉与模式识别 2024-06-04 v1

摘要

多模态显著目标检测(MSOD)旨在通过整合可见光与深度或热红外源来提升显著性检测性能。现有方法通常设计不同的融合方案来处理特定问题或挑战。尽管这些融合方案在解决特定问题或挑战时有效,但它们可能难以同时处理多个复杂的挑战。为解决此问题,我们提出了一种新颖的自适应融合库,该库充分利用一组基本融合方案的互补优势,以同时处理不同挑战,实现鲁棒的MSOD。我们专注于处理MSOD中的五个主要挑战,即中心偏差、尺度变化、图像杂乱、低光照以及热交叉或深度模糊。所提出的融合库由五种代表性的融合方案组成,这些方案分别基于每个挑战的特性而专门设计。该库是可扩展的,可以加入更多融合方案以应对更多挑战。为了自适应地为多模态输入选择合适的融合方案,我们引入了一个自适应集成模块,该模块构成了自适应融合库,并将其嵌入到层次化层中以实现不同源数据的充分融合。此外,我们设计了一个间接交互引导模块,通过跳跃整合高层语义信息和低层空间细节来准确检测显著的镂空物体。在三个RGBT数据集和七个RGBD数据集上的大量实验表明,与最先进的方法相比,所提出的方法取得了卓越的性能。代码和结果可在 https://github.com/Angknpng/LAFB 获取。

关键词

引用

@article{arxiv.2406.01127,
  title  = {Learning Adaptive Fusion Bank for Multi-modal Salient Object Detection},
  author = {Kunpeng Wang and Zhengzheng Tu and Chenglong Li and Cheng Zhang and Bin Luo},
  journal= {arXiv preprint arXiv:2406.01127},
  year   = {2024}
}

备注

Accepted by TCSVT 2024