中文

MGD-SAM2:面向高分辨率无类别分割的多视角引导细节增强型 Segment Anything Model 2

计算机视觉与模式识别 2025-04-01 v1 人工智能

摘要

Segment Anything Models (SAMs) 作为视觉基础模型,已在 various 图像分析任务中展现出卓越的性能。尽管具备强大的泛化能力,SAMs 在处理高分辨率无类别分割 (HRCS) 的细粒度细节分割方面面临挑战,这源于对高分辨率输入直接处理以及低分辨率掩码预测的局限性,以及依赖准确手动提示的局限。为此,我们提出 MGD-SAM2 将 SAM2 与全局图像与局部图像块之间的多视角特征交互相结合,以实现精准分割。MGD-SAM2 集成了预训练的 SAM2 及四个新模块:Multi-view Perception Adapter (MPAdapter)、Multi-view Complementary Enhancement Module (MCEM)、Hierarchical Multi-view Interaction Module (HMIM) 和 Detail Refinement Module (DRM)。具体而言,我们首先引入 MPAdapter 为 HRCS 图像中的局部细节与全局语义增强提取做好准备。随后,提出 MCEM 和 HMIM 通过在多尺度范围内聚合多视角特征,进一步挖掘局部纹理与全局上下文。最后,设计 DRM 以生成逐步恢复的高分辨率掩码预测,弥补直接上采样低分辨率预测图所导致的细粒度细节丢失。实验结果表明,该模型在多个高分辨率和常规分辨率数据集上表现优异且具有强大的泛化能力。代码将在 https://github.com/sevenshr/MGD-SAM2 提供。

关键词

引用

@article{arxiv.2503.23786,
  title  = {MGD-SAM2: Multi-view Guided Detail-enhanced Segment Anything Model 2 for High-Resolution Class-agnostic Segmentation},
  author = {Haoran Shen and Peixian Zhuang and Jiahao Kou and Yuxin Zeng and Haoying Xu and Jiangyun Li},
  journal= {arXiv preprint arXiv:2503.23786},
  year   = {2025}
}