中文

多模态情境下的Segment Anything

计算机视觉与模式识别 2024-08-20 v1

摘要

稳健且准确的场景分割已成为各种视觉识别和导航任务中的核心功能。这激发了最近开发出Segment Anything Model (SAM)——一种通用掩码分割的基础模型。然而,SAM主要针对单模态RGB图像进行优化,限制了其针对由广泛采用的传感器套件捕获的多模态数据(如LiDAR加RGB、深度加RGB、热成像加RGB等)的适用性。我们开发了MM-SAM,这是SAM的一个扩展和扩张,支持跨模态和多模态处理,以实现针对不同传感器套件的稳健且增强的分割。MM-SAM具有两种关键设计,即无监督的跨模态迁移和弱监督的多模态融合,使其能够实现对各种传感器模态的标签高效和参数高效的适应。它解决了三个主要挑战:1)针对各种非RGB传感器进行单模态处理的适应性,2)通过传感器融合实现多模态数据的协同处理,3)针对不同下游任务的无掩码训练。大量实验表明,MM-SAM在各种传感器和数据模态上均显著优于SAM,充分展示了其有效性和鲁健性。

关键词

引用

@article{arxiv.2408.09085,
  title  = {Segment Anything with Multiple Modalities},
  author = {Aoran Xiao and Weihao Xuan and Heli Qi and Yun Xing and Naoto Yokoya and Shijian Lu},
  journal= {arXiv preprint arXiv:2408.09085},
  year   = {2024}
}

备注

Project page: https://xiaoaoran.github.io/projects/MM-SAM