中文

ClinicalFMamba:基于 Mamba 的多模态神经影像融合推进临床评估

图像与视频处理 2025-08-06 v1 人工智能 计算机视觉与模式识别

摘要

多模态医学图像融合整合来自不同成像模态的互补信息,以提高诊断准确性和治疗规划。虽然深度学习方法提升了性能,但现有方法面临关键局限性:卷积神经网络(CNN)擅长局部特征提取,但在有效建模全局上下文方面存在困难;而 Transformer 以二次计算复杂度为代价实现了卓越的长程建模,限制了临床部署。最近的状态空间模型(SSM)提供了一种有前景的替代方案,通过选择性扫描机制在线性时间内实现高效的长程依赖建模。尽管取得了这些进展,但向 3D 体积数据的扩展和融合图像的临床验证仍然探索不足。在这项工作中,我们提出了 ClinicalFMamba,一种新颖的端到端 CNN-Mamba 混合架构,协同结合了 2D 和 3D 图像的局部和全局特征建模。我们进一步设计了一种三平面扫描策略,以有效地学习 3D 图像中的体积依赖关系。在三个数据集上的综合评估表明,在多个定量指标上实现了卓越的融合性能,同时实现了实时融合。我们进一步在下游 2D/3D 脑肿瘤分类任务上验证了我们方法的临床效用,取得了优于基线方法的性能。我们的方法为适用于实时临床部署的高效多模态医学图像融合建立了一种新范式。

关键词

引用

@article{arxiv.2508.03008,
  title  = {ClinicalFMamba: Advancing Clinical Assessment using Mamba-based Multimodal Neuroimaging Fusion},
  author = {Meng Zhou and Farzad Khalvati},
  journal= {arXiv preprint arXiv:2508.03008},
  year   = {2025}
}

备注

Accepted at MICCAI MLMI 2025 Workshop