中文

面向语言引导医学图像分割的跨模态条件重构

计算机视觉与模式识别 2024-07-09 v2

摘要

近期的发展突显了文本信息在增强学习模型以深入理解医学视觉语义方面的潜力。然而,语言引导的医学图像分割仍面临一个具有挑战性的问题。以往的工作采用隐式且模糊的架构来嵌入文本信息。这导致分割结果与语言所表示的语义不一致,有时甚至存在显著偏离。为此,我们提出了一种用于语言引导医学图像分割的新型跨模态条件重构(RecLMIS),以显式捕获跨模态交互,该方法假设良好对齐的医学视觉特征和医学笔记能够有效地相互重构。我们引入条件交互来自适应地预测感兴趣的图像块和单词。随后,它们被用作相互重构的条件因子,以与医学笔记中描述的区域相对齐。大量实验证明了我们 RecLMIS 的优越性,在公开的 MosMedData+ 数据集上 mIoU 超过 LViT 3.74%,并在我们的 QATA-CoV19 数据集上的跨域测试中实现了 1.89% 的平均 mIoU 提升。同时,我们实现了参数量 20.2% 的相对减少和计算负载 55.5% 的降低。代码将在 https://github.com/ShashankHuang/RecLMIS 上提供。

关键词

引用

@article{arxiv.2404.02845,
  title  = {Cross-Modal Conditioned Reconstruction for Language-guided Medical Image Segmentation},
  author = {Xiaoshuang Huang and Hongxiang Li and Meng Cao and Long Chen and Chenyu You and Dong An},
  journal= {arXiv preprint arXiv:2404.02845},
  year   = {2024}
}