中文

用于语义分割的多模态 SAM-adapter

计算机视觉与模式识别 2025-09-15 v1 人工智能

摘要

语义分割是计算机视觉中的一项关键任务,在自动驾驶、医学影像和机器人领域有广泛应用,它已随着深度学习取得了长足进步。然而,当前方法在光照不良、遮挡和恶劣天气等挑战性条件下仍然容易受到影响。为解决这些局限性,整合辅助传感器数据(如 LiDAR、红外)的多模态方法近期应运而生,提供增强鲁棒性的互补信息。在本工作中,我们提出了 MM SAM-adapter,这是一种扩展 Segment Anything Model(SAM)能力以用于多模态语义分割的新颖框架。该方法采用一个 adapter 网络,将融合的多模态特征注入 SAM 丰富的 RGB 特征中。这种设计使模型能够保留 RGB 特征的强泛化能力,同时仅在辅助模态提供额外线索时选择性地将其纳入。因此,MM SAM-adapter 实现了对多模态信息的均衡且高效的利用。我们在三个具有挑战性的基准 DeLiVER、FMB 和 MUSES 上评估了我们的方法,其中 MM SAM-adapter 提供了最先进的性能。为进一步分析模态贡献,我们将 DeLiVER 和 FMB 划分为 RGB-easy 和 RGB-hard 子集。结果一致表明,我们的框架在有利和不利条件下均优于竞争方法,突显了多模态适配对鲁棒场景理解的有效性。代码可在以下链接获取:https://github.com/iacopo97/Multimodal-SAM-Adapter。

关键词

引用

@article{arxiv.2509.10408,
  title  = {Multimodal SAM-adapter for Semantic Segmentation},
  author = {Iacopo Curti and Pierluigi Zama Ramirez and Alioscia Petrelli and Luigi Di Stefano},
  journal= {arXiv preprint arXiv:2509.10408},
  year   = {2025}
}