MambaSOD:基于双Mamba驱动的RGB-D显著物体检测跨模态融合网络
计算机视觉与模式识别
2024-10-22 v1
摘要
RGB-D显著物体检测(SOD)旨在准确定位图像中最具视觉显现性的区域。虽然传统深度模型严重依赖CNN提取器并忽视长程上下文依赖,但后续基于transformer的模型在一定程度上解决了此问题,却引入了高计算复杂度。此外,融合深度图中的空间信息被证明对该任务有效。该问题的主要挑战在于如何有效融合RGB和深度数据的互补信息。本文提出一种基于双Mamba驱动的跨模态融合网络用于RGB-D SOD,称为MambaSOD。具体而言,我们首先为RGB和深度数据采用双Mamba驱动的特征提取器,以线性复杂度建模多模态输入中的长程依赖。随后,我们设计一种跨模态融合Mamba,用于处理捕获的多模态特征,以充分利用RGB和深度特征之间的互补信息。据我们所知,本工作是首次尝试在RGB-D SOD任务中探索Mamba的潜力,提供了一种新颖的视角。大量实验表明,我们的方法在六个主流数据集上优于十六个当前最先进的RGB-D SOD模型。源代码将在https://github.com/YueZhan721/MambaSOD发布。
关键词
引用
@article{arxiv.2410.15015,
title = {MambaSOD: Dual Mamba-Driven Cross-Modal Fusion Network for RGB-D Salient Object Detection},
author = {Yue Zhan and Zhihong Zeng and Haijun Liu and Xiaoheng Tan and Yinli Tian},
journal= {arXiv preprint arXiv:2410.15015},
year = {2024}
}