中文

弥合感知-认知鸿沟:用 Hilbert-Mamba 重新工程化 SAM2 以实现稳健的基于 VLM 的医学诊断

计算机视觉与模式识别 2026-01-01 v1

摘要

近期研究表明,视觉语言模型在自动化医学诊断等任务中具有巨大潜力。然而,处理复杂的三维 (3D) 多模态医学图像带来了重大挑战——特别是互补信息的有效整合,以及对细微但关键病理特征的偶尔疏忽。为了解决这些问题,我们提出了一个名为 Hilbert-VLM 的新型两阶段融合框架。该框架利用 HilbertMed-SAM 模块进行精确的病灶分割,随后生成的多模态增强提示引导 VLM 进行准确的疾病分类。我们的核心创新在于对 Segment Anything Model 2 (SAM2) 架构的系统性重新设计:我们将 Hilbert 空间填充曲线引入 Mamba 状态空间模型 (SSM) 的扫描机制中,以最大化保留 3D 数据中的空间局部性,这一性质对医学图像分析至关重要。我们还引入了新颖的 Hilbert-Mamba 交叉注意力 (HMCA) 机制和尺度感知解码器以捕捉细粒度细节。同时,提示增强模块将分割掩码及其对应的文本属性统一为信息密集的提示,以支持 VLM 推理。我们进行了大量实验以验证 Hilbert-VLM 模型的有效性。在 BraTS2021 分割基准上,它实现了 82.35% 的 Dice 分数,诊断分类准确率 (ACC) 为 78.85%。这些结果表明,所提出的模型在提高基于医学 VLM 分析的准确性和可靠性方面具有巨大潜力。

关键词

引用

@article{arxiv.2512.24013,
  title  = {Bridging the Perception-Cognition Gap:Re-engineering SAM2 with Hilbert-Mamba for Robust VLM-based Medical Diagnosis},
  author = {Hao Wu and Hui Li and Yiyun Su},
  journal= {arXiv preprint arXiv:2512.24013},
  year   = {2026}
}