中文

语言引导的医学图像分割:基于目标感知的多层级对比对齐

计算机视觉与模式识别 2026-01-23 v3

摘要

医学图像分割是众多医学工程应用中的基础任务。近年来,在文本临床报告可作为语义引导的医疗场景中,语言引导的分割显示出前景。临床报告包含临床医生提供的诊断信息,可以提供辅助的文本语义来指导分割。然而,现有的语言引导分割方法忽略了图像和文本模态之间的固有模式差距,导致视觉-语言融合欠佳。对比学习是一种公认的对齐图像-文本模式的方法,但它尚未针对弥合医学语言引导分割中的模式差距进行优化,这种分割主要依赖医学图像细节来表征潜在疾病/目标。当前的对比对齐技术通常对齐高级全局语义,而不涉及低级局部目标信息,因此无法在关键图像细节上提供细粒度的文本引导。在本研究中,我们提出了一个目标感知的多层级对比对齐框架(TMCA),以弥合医学语言引导分割中的图像-文本模式差距。TMCA通过引入以下机制实现了目标感知的图像-文本对齐和细粒度文本引导:(i)一个目标敏感语义距离模块,利用目标信息进行更细粒度的图像-文本对齐建模;(ii)一个多层级对比对齐策略,将细粒度文本引导定向到多尺度图像细节;(iii)一个语言引导的目标增强模块,基于对齐的图像-文本模式强化对关键图像区域的关注。在四个公开基准数据集上的大量实验表明,TMCA在性能上优于最先进的医学语言引导分割方法。

关键词

引用

@article{arxiv.2412.13533,
  title  = {Language-guided Medical Image Segmentation with Target-informed Multi-level Contrastive Alignments},
  author = {Mingjian Li and Mingyuan Meng and Shuchang Ye and Michael Fulham and Lei Bi and Jinman Kim},
  journal= {arXiv preprint arXiv:2412.13533},
  year   = {2026}
}