中文

MedCLIP-SAMv2:面向通用文本驱动医学图像分割

计算机视觉与模式识别 2025-02-18 v4 计算与语言

摘要

医学图像中解剖结构和病理区域的分割是现代临床诊断、疾病研究和治疗规划的必不可少的任务。虽然已在深度学习分割技术上取得显著进展,但许多方法仍存在数据效率、通用性和交互性方面的局限性。因此,开发需要更少标记数据集即可实现的精确分割方法仍是医学图像分析中的关键挑战。最近,引入具有鲁棒跨域表示的基础模型(如 CLIP 和 Segment-Anything-Model (SAM)),为交互式和通用图像分割铺平了道路。然而,对这些模型在医学成像中实现数据高效分割的进一步探索仍然迫切且高度相关。本文介绍 MedCLIP-SAMv2,一种新型框架,将 CLIP 和 SAM 模型集成,以文本提示在临床扫描上执行分割,适用于零样本和弱监督设置。我们的方法包括使用新的解耦式硬负采样噪声对比度估计 (DHN-NCE) 损失函数微调 BiomedCLIP 模型,并利用多模态信息瓶颈 (M2IB) 为生成 SAM 中的分割掩码创建视觉提示。我们还研究在弱监督范式中使用零样本分割标签以进一步提升分割质量。广泛的测试涵盖四种多样化的分割任务和医学成像模态(乳腺肿瘤超声、脑肿瘤 MRI、肺部 X 光片和肺部 CT),显示我们提出的框架表现高准确。我们的代码已公开于 https://github.com/HealthX-Lab/MedCLIP-SAMv2。

关键词

引用

@article{arxiv.2409.19483,
  title  = {MedCLIP-SAMv2: Towards Universal Text-Driven Medical Image Segmentation},
  author = {Taha Koleilat and Hojat Asgariandehkordi and Hassan Rivaz and Yiming Xiao},
  journal= {arXiv preprint arXiv:2409.19483},
  year   = {2025}
}

备注

10 pages, 2 figures, 6 tables