中文

迈向通用的文本驱动 CT 图像分割

计算机视觉与模式识别 2025-03-11 v1 人工智能

摘要

计算机断层扫描(CT)被广泛用于器官和病灶的准确可视化与分割。尽管卷积神经网络和视觉 Transformer等深度学习模型显著改善了 CT 图像分析,但它们在应用于多样化的真实世界临床数据时,性能通常会下降。虽然基础模型提供了更广泛、更适应性强的解决方案,但由于难以获得医学图像的大规模体素级标注,其潜力受到限制。为了应对这些挑战,出现了使用视觉或文本提示的基于提示的模型。视觉提示方法(如 Segment Anything Model (SAM))仍需要大量手动输入,并且在应用于临床场景时可能引入歧义。相反,使用文本提示的基础模型提供了一种更通用且与临床相关的方法。值得注意的是,当前的文本提示模型(如 CLIP-Driven Universal Model)仅限于训练期间已遇到的文本提示,难以处理真实世界临床应用中复杂多样的场景。我们没有对基于自然图像训练的模型进行微调,而是提出了 OpenVocabCT,这是一种在大规模 3D CT 图像上预训练的视觉-语言模型,用于通用的文本驱动分割。利用大规模 CT-RATE 数据集,我们使用大型语言模型将诊断报告分解为细粒度的器官级描述,以进行多粒度对比学习。我们在九个公共数据集的器官和肿瘤分割的下游任务上评估了 OpenVocabCT,证明了我们的模型与现有方法相比具有优越的性能。所有代码、数据集和模型将在 https://github.com/ricklisz/OpenVocabCT 上公开发布。

关键词

引用

@article{arxiv.2503.06030,
  title  = {Towards Universal Text-driven CT Image Segmentation},
  author = {Yuheng Li and Yuxiang Lai and Maria Thor and Deborah Marshall and Zachary Buchwald and David S. Yu and Xiaofeng Yang},
  journal= {arXiv preprint arXiv:2503.06030},
  year   = {2025}
}