面向多模态显著性目标检测的 Segment Anything Model 适配: 语义特征融合指导
计算机视觉与模式识别
2024-11-13 v4
摘要
虽然大多数现有的多模态显著性目标检测(SOD)方法通过从头训练模型来显示有效性, 但受限于多模态数据的不足, 这些方法难以达到最优。本文提出了一个新框架, 以探索和利用预训练的 Segment Anything Model(SAM)的强大特征表示和零样本泛化能力用于多模态 SOD。尽管 SAM 是近期的视觉基础模型, 驱动其 class-agnostic SAM 理解和准确检测显著性目标并不容易, 尤其是在具有挑战性场景时。为此, 我们开发了以语义特征融合指导命名为 \underline{SAM} with se\underline{m}antic f\underline{e}ature fu\underline{s}ion guidanc\underline{e}(Sammese)的框架, 将多模态显著性特定知识整合到 SAM 中以适应多模态 SOD 任务。然而, 仅针对单模态数据训练的 SAM 直接从多模态输入中挖掘互补收益并全面利用它们以实现准确显著性预测并不容易。为此, 我们首先设计了一个多模态互补融合模块, 通过整合可见光和热力学或深度图像对中的信息来提取稳健的多模态语义特征。随后, 我们将提取的多模态语义特征输入到 SAM 的图像编码器和掩码解码器中进行微调和提示。具体而言, 在图像编码器中, 提出了一个多模态适配器来将单模态 SAM 适应为多模态信息。在掩码解码器中, 提出了一种语义-几何提示生成策略, 以产生各种显著性线索对应的嵌入。大量实验在 RGB-D 和 RGB-T SOD 数据集上显示, 所提框架有效。代码将在 \url{https://github.com/Angknpng/Sammese} 上提供。
引用
@article{arxiv.2408.15063,
title = {Adapting Segment Anything Model to Multi-modal Salient Object Detection with Semantic Feature Fusion Guidance},
author = {Kunpeng Wang and Danying Lin and Chenglong Li and Zhengzheng Tu and Bin Luo},
journal= {arXiv preprint arXiv:2408.15063},
year = {2024}
}
备注
10 pages, 9 figures