中文

MemorySAM:利用 Segment Anything Model 2 记忆模态与语义以实现多模态语义分割

计算机视觉与模式识别 2025-03-24 v2

摘要

研究一直聚焦于多模态语义分割(MMSS),其中像素级预测源自不同传感器捕获的多种视觉模态。近期,大型视觉模型 Segment Anything Model 2(SAM2)在图像和视频上均展现出了强大的零样本分割性能。在将 SAM2 扩展至 MMSS 时,出现了两个问题:1. 如何使 SAM2 适应多模态数据?2. 如何使 SAM2 更好地理解语义?受视频中跨帧相关性的启发,我们提出将多模态数据视为表示同一场景的帧序列。我们的核心思想是“记忆”与模态无关的信息,并“记忆”与目标场景相关的语义。为此,我们在多模态数据间应用 SAM2 的记忆机制以捕获与模态无关的特征。同时,为了记忆语义知识,我们提出了一个仅用于训练的语义原型记忆模块(SPMM),以在训练过程中存储类别级原型,从而促进 SAM2 从实例分割向语义分割的过渡。全局与局部原型之间迭代施加原型适应损失,以对齐并优化 SAM2 的语义理解。大量实验结果表明,我们提出的 MemorySAM 在合成与真实世界基准上均大幅优于 SoTA 方法(在 DELIVER 上为 65.38%,在 MCubeS 上为 52.88%)。源代码将公开发布。

关键词

引用

@article{arxiv.2503.06700,
  title  = {MemorySAM: Memorize Modalities and Semantics with Segment Anything Model 2 for Multi-modal Semantic Segmentation},
  author = {Chenfei Liao and Xu Zheng and Yuanhuiyi Lyu and Haiwei Xue and Yihong Cao and Jiawen Wang and Kailun Yang and Xuming Hu},
  journal= {arXiv preprint arXiv:2503.06700},
  year   = {2025}
}