中文

用于腹部 CT 器官分割和肿瘤检测的通用可扩展语言-视觉模型

图像与视频处理 2024-05-29 v1 计算机视觉与模式识别

摘要

人工智能(AI)在器官分割和肿瘤检测方面的发展,得益于来自多个具有详细 per-voxel 注释的 CT 数据集的不断增长。然而,这些 AI 模型常常在灵活性和可扩展性方面受限,尤其是对于部分注释的数据集和新类的适应性,因为 one-hot 编码、架构设计和学习方案存在局限。为克服这些限制,我们提出了一个通用可扩展框架,称为 Universal Model,单个模型即可处理多个公开数据集并适应新类(如器官/肿瘤)。首先,我们引入一种新的 language-driven 参数生成器,利用来自大型语言模型的 language embeddings,丰富语义编码。其次,用轻量级、特定于类的 heads 替代常规输出层,使 Universal Model 能够同时分割 25 种器官和 6 种肿瘤类型,并简化新类的添加。我们在 3,410 个 CT 体积上训练了 Universal Model,这些体积来自 14 个公开数据集,然后在 6,173 个来自 4 个外部数据集的 CT 体积上进行测试。Universal Model 在 Medical Segmentation Decathlon(MSD)公开排行榜上的 6 个 CT 任务中取得第一名,在 Beyond The Cranial Vault(BTCV)数据集上取得领先性能。总之,Universal Model 在计算效率方面表现突出(比其他数据集特定模型快 6 倍),在不同医院之间展现出强大的泛化能力,在众多下游任务中表现出良好的迁移能力,更重要的是,促进了对新类的可扩展性,同时减轻了对以前学习类的灾难性遗忘。代码、模型和数据集均可在 https://github.com/ljwztc/CLIP-Driven-Universal-Model 获取。

关键词

引用

@article{arxiv.2405.18356,
  title  = {Universal and Extensible Language-Vision Models for Organ Segmentation and Tumor Detection from Abdominal Computed Tomography},
  author = {Jie Liu and Yixiao Zhang and Kang Wang and Mehmet Can Yavuz and Xiaoxi Chen and Yixuan Yuan and Haoliang Li and Yang Yang and Alan Yuille and Yucheng Tang and Zongwei Zhou},
  journal= {arXiv preprint arXiv:2405.18356},
  year   = {2024}
}

备注

Accepted to Medical Image Analysis