CLIP驱动的器官分割与肿瘤检测通用模型
图像与视频处理
2024-06-27 v5 计算机视觉与模式识别
机器学习
摘要
越来越多的公共数据集对自动化器官分割与肿瘤检测产生了显著影响。然而,由于每个数据集规模小且存在部分标注问题,以及对多种类型肿瘤的研究有限,由此得到的模型往往仅限于分割特定器官/肿瘤,忽略了解剖结构的语义,也无法扩展到新领域。为解决这些问题,我们提出了CLIP驱动的通用模型(CLIP-Driven Universal Model),该模型将从对比语言-图像预训练(CLIP)中学习到的文本嵌入整合到分割模型中。这种基于CLIP的标签编码捕捉了解剖关系,使模型能够学习结构化的特征嵌入,并分割25个器官和6类肿瘤。所提模型由14个数据集组合开发,使用共计3,410张CT扫描进行训练,随后在来自另外3个数据集的6,162张外部CT扫描上进行评估。我们在Medical Segmentation Decathlon(MSD)公共排行榜上排名第一,并在Beyond The Cranial Vault(BTCV)上取得了最先进(state-of-the-art)的结果。此外,与特定数据集的模型相比,该通用模型计算效率更高(快6倍),对来自不同站点的CT扫描泛化性更好,并在新任务上展现出更强的迁移学习性能。
引用
@article{arxiv.2301.00785,
title = {CLIP-Driven Universal Model for Organ Segmentation and Tumor Detection},
author = {Jie Liu and Yixiao Zhang and Jie-Neng Chen and Junfei Xiao and Yongyi Lu and Bennett A. Landman and Yixuan Yuan and Alan Yuille and Yucheng Tang and Zongwei Zhou},
journal= {arXiv preprint arXiv:2301.00785},
year = {2024}
}
备注
ICCV-2023; Rank first in Medical Segmentation Decathlon (MSD) Competition