中文

用于语言引导医学图像分割的频域多模态融合

计算机视觉与模式识别 2025-09-25 v1

摘要

自动分割放射图像中的感染区域对于诊断肺部传染性疾病至关重要。近期研究表明,通过将临床文本报告作为语义引导,可以提高医学图像分割的准确性。然而,病变复杂的形态变化以及视觉-语言模态之间固有的语义鸿沟,使得现有方法无法有效增强视觉特征表示并消除语义无关信息,最终导致分割性能不佳。为了解决这些问题,我们提出了一种用于语言引导医学图像分割的频域多模态交互模型(FMISeg)。FMISeg 是一种晚期融合模型,在解码器中建立语言特征与频域视觉特征之间的交互。具体而言,为增强视觉表示,我们的方法引入了一个频域特征双向交互(FFBI)模块,以有效融合频域特征。此外,在解码器中引入了一个语言引导频域特征交互(LFFI)模块,在语言信息的引导下抑制语义无关的视觉特征。在 QaTa-COV19 和 MosMedData+ 上的实验表明,我们的方法在定性和定量方面均优于最先进的方法。

关键词

引用

@article{arxiv.2509.19719,
  title  = {Frequency-domain Multi-modal Fusion for Language-guided Medical Image Segmentation},
  author = {Bo Yu and Jianhua Yang and Zetao Du and Yan Huang and Chenglong Li and Liang Wang},
  journal= {arXiv preprint arXiv:2509.19719},
  year   = {2025}
}

备注

Accepted by MICCAI 2025