中文

面向新冠检测的3D CT扫描分割的SAM2CLIP2SAM视觉语言模型

图像与视频处理 2024-07-25 v2 计算机视觉与模式识别

摘要

本文提出了一种可集成到任何模型和方法中的新型图像分割方法;我们采用的范式是对医学图像(3D胸部CT扫描)进行新冠检测分类。我们的方案结合了视觉语言模型进行图像分割,然后将分割结果输入深度神经网络架构(RACNet)进行新冠检测。具体而言,引入了名为SAM2CLIP2SAM的新型框架,用于分割,该框架利用Segment Anything Model(SAM)和Contrastive Language-Image Pre-Training(CLIP)的优势,准确分割CT扫描中的右肺和左肺,随后将分割输出输入RACNet进行COVID-19和非COVID-19病例的分类。首先,SAM为每个CT扫描切片生成多个基于部件的分割掩码;随后CLIP筛选出与感兴趣区域(ROI,即右肺和左肺)相关的掩码;最后将这些ROI作为提示输入SAM,生成肺部的最终分割掩码。 presented across two Covid-19 annotated databases which illustrate the improved performance obtained when our method has been used for segmentation of the CT scans.

关键词

引用

@article{arxiv.2407.15728,
  title  = {SAM2CLIP2SAM: Vision Language Model for Segmentation of 3D CT Scans for Covid-19 Detection},
  author = {Dimitrios Kollias and Anastasios Arsenos and James Wingate and Stefanos Kollias},
  journal= {arXiv preprint arXiv:2407.15728},
  year   = {2024}
}