Mamba 作为桥梁:视觉基础模型与视觉语言模型在域泛化语义分割中的融合
计算机视觉与模式识别
2025-04-16 v2
摘要
视觉基础模型(VFMs)和视觉-语言模型(VLMs)因其强大的泛化能力在域泛化语义分割(DGSS)中获得了关注。然而,现有的 DGSS 方法往往仅依赖 VFMs 或 VLMs 之一,忽略了它们的互补优势。VFMs(如 DINOv2)擅长捕获细粒度特征,而 VLMs(如 CLIP)提供鲁棒的文本对齐但难以处理粗粒度。尽管它们具有互补优势,但通过注意力机制有效融合 VFMs 和 VLMs 仍具有挑战性,因为增加的 patch 令牌使长序列建模变得复杂。为解决这一问题,我们提出了 MFuser,一种基于 Mamba 的新型融合框架,能够高效结合 VFMs 和 VLMs 的优势,同时保持序列长度的线性可扩展性。MFuser 由两个关键组件组成:MVFuser,作为协同适配器通过捕获序列和空间动态联合微调两个模型;以及 MTEnhancer,一个混合注意力-Mamba 模块,通过融入图像先验来精炼文本嵌入。我们的方法在实现精确特征定位和强文本对齐的同时未带来显著的计算开销。大量实验表明 MFuser 显著优于最先进的 DGSS 方法,在合成到真实基准上达到 68.20 mIoU,在真实到真实基准上达到 71.87 mIoU。代码可在 https://github.com/devinxzhang/MFuser 获取。
引用
@article{arxiv.2504.03193,
title = {Mamba as a Bridge: Where Vision Foundation Models Meet Vision Language Models for Domain-Generalized Semantic Segmentation},
author = {Xin Zhang and Robby T. Tan},
journal= {arXiv preprint arXiv:2504.03193},
year = {2025}
}
备注
Accepted to CVPR 2025 (Highlight)