中文

SwinTextUNet:将基于 CLIP 的文本指导集成到 Swin Transformer U-Net 用于医学图像分割

计算机视觉与模式识别 2026-04-14 v1

摘要

精准的医学图像分割是实现计算机辅助诊断和有效治疗规划的基本要求。依赖单一视觉特征的传统模型在面对模糊或低对比度模式时常常难以胜任。为克服这些限制,我们引入 SwinTextUNet,一种多模态分割框架,将基于 CLIP 的对比语言图像预训练(CLIP)派生的文本嵌入整合到 Swin Transformer UNet 主干网络中。通过集成交叉注意力和卷积融合,该模型有效地将语义文本指导与层次化视觉表征对齐,从而增强了模型的鲁棒性和准确性。我们在 QaTaCOV19 数据集上对方法进行评估,结果表明该方案在性能与复杂度之间实现了最佳平衡,Dice 得分达 86.47%,IoU 得分达 78.2%。消融研究进一步验证了文本指导和多模态融合的重要性。这些发现凸显了视觉语言集成在推动医学图像分割方面的潜力,并支持构建临床上具有意义的诊断工具。

关键词

引用

@article{arxiv.2604.10000,
  title  = {SwinTextUNet: Integrating CLIP-Based Text Guidance into Swin Transformer U-Nets for Medical Image Segmentation},
  author = {Ashfak Yeafi and Parthaw Goswami and Md Khairul Islam and Ashifa Islam Shamme},
  journal= {arXiv preprint arXiv:2604.10000},
  year   = {2026}
}