中文

VM-DDPM:用于医学图像合成的 Vision Mamba 扩散模型

图像与视频处理 2024-05-10 v1 计算机视觉与模式识别

摘要

在智慧医疗领域,研究人员通过医学图像合成来增强医学数据集的规模和多样性。然而,现有方法受限于 CNN 的局部感知和 Transformer 的二次复杂度,难以平衡结构纹理的一致性。为此,我们提出了基于 State Space Model (SSM) 的 Vision Mamba DDPM (VM-DDPM),充分结合 CNN 的局部感知能力和 SSM 的全局建模能力,同时保持线性计算复杂度。具体而言,我们设计了一个称为 Multi-level State Space Block (MSSBlock) 的多级特征提取模块,以及一个用于医学病理图像的编码器-解码器结构的基本单元 State Space Layer (SSLayer)。此外,我们为 Cross-Scan Module (CSM) 设计了一种简单、即插即用、零参数的 Sequence Regeneration 策略,使 S6 模块能够充分感知 2D 图像的空间特征并激发模型的泛化潜力。据我们所知,这是首个基于 SSM-CNN 混合架构的医学图像合成模型。我们在不同规模的三个数据集(即 ACDC、BraTS2018 和 ChestXRay)上进行了实验评估,以及放射科医生的定性评估,结果表明 VM-DDPM 达到了 SOTA 性能。

关键词

引用

@article{arxiv.2405.05667,
  title  = {VM-DDPM: Vision Mamba Diffusion for Medical Image Synthesis},
  author = {Zhihan Ju and Wanting Zhou},
  journal= {arXiv preprint arXiv:2405.05667},
  year   = {2024}
}