SSNet:基于显著性先验与状态空间模型的 RGB-D 图像显著目标检测网络
计算机视觉与模式识别
2025-03-05 v1
摘要
RGB-D 图像中的显著目标检测(SOD)是计算机视觉中的一项重要任务,可应用于场景理解、机器人和增强现实。然而,现有方法难以捕捉跨模态的全局依赖关系,缺乏来自 RGB 和深度数据的全面显著性先验,且在处理低质量深度图时效果不佳。为了解决这些挑战,我们提出了 SSNet,一种用于 RGB-D SOD 任务的基于显著性先验与状态空间模型(SSM)的网络。与现有的基于卷积或 Transformer 的方法不同,SSNet 引入了一个基于 SSM 的多模态多尺度解码器模块,以线性复杂度高效捕捉模态内与模态间的全局依赖关系。具体而言,我们提出了一种跨模态选择性扫描 SSM (CM-S6) 机制,能够有效捕捉不同模态间的全局依赖关系。此外,我们引入了一个显著性增强模块(SEM),将三种显著性先验与深度特征相结合,以精炼特征表示并改善显著目标的定位。为了进一步解决低质量深度图的问题,我们提出了一种自适应对比度增强技术,能够动态优化深度图,使其更适合 RGB-D SOD 任务。在七个基准数据集上的大量定量与定性实验表明,SSNet 优于 SOTA 方法。
引用
@article{arxiv.2503.02270,
title = {SSNet: Saliency Prior and State Space Model-based Network for Salient Object Detection in RGB-D Images},
author = {Gargi Panda and Soumitra Kundu and Saumik Bhattacharya and Aurobinda Routray},
journal= {arXiv preprint arXiv:2503.02270},
year = {2025}
}