中文

CDPDNet:将文本引导集成到混合视觉编码器用于医学图像分割

计算机视觉与模式识别 2025-05-28 v2

摘要

大多数公开可用的医学分割数据集仅对部分解剖结构提供注释,导致当多个数据集组合用于训练时,模型难以学习各数据集间共享的解剖表征。此外,基于视觉的框架往往难以捕获复杂的解剖关系和任务特定的区分,导致分割精度下降且对未见数据集的泛化性差。为此,本文提出了一种新型CLIP-DINO Prompt-Driven分割网络(CDPDNet),其结合了自监督视觉变换器与CLIP-based文本嵌入,并引入任务特定文本提示以应对上述挑战。具体而言,该框架建立在卷积神经网络(CNN)之上,集成DINOv2以提取细粒度与全局视觉特征,随后通过多头跨注意力模块进行融合,以克服CNN在长程建模能力上的限制。此外,将CLIP派生的文本嵌入投射到视觉空间,以帮助模型捕获器器和肿瘤之间的复杂关系。为进一步应对部分标签挑战并增强任务间判别能力,我们设计了基于文本的任务提示生成(TTPG)模块,以生成任务特定的提示来指导分割。在多个医学影像数据集上的大量实验表明,CDPDNet持续优于现有最先进的分割方法。代码与预训练模型已提供于:https://github.com/wujiong-hub/CDPDNet.git。

关键词

引用

@article{arxiv.2505.18958,
  title  = {CDPDNet: Integrating Text Guidance with Hybrid Vision Encoders for Medical Image Segmentation},
  author = {Jiong Wu and Yang Xing and Boxiao Yu and Wei Shao and Kuang Gong},
  journal= {arXiv preprint arXiv:2505.18958},
  year   = {2025}
}