基于文本提示的医学图像大词汇量分割
图像与视频处理
2025-07-21 v5 计算机视觉与模式识别
摘要
本文旨在构建一个模型,能够由医学术语作为文本提示驱动,对 3D 医学图像进行“分割一切”,称为 SAT。我们的主要贡献有三方面:(i) 我们构建了首个人体解剖多模态知识树,包含 6502 个解剖学术语;随后,我们构建了最大且最全面的训练用分割数据集,从 72 个数据集中收集了超过 22K 个 3D 扫描,涵盖 497 个类别,并在图像和标签空间进行了仔细标准化;(ii) 我们提出通过对比学习将医学知识注入文本编码器,并构建了一个大词汇量分割模型,该模型可由文本形式的医学术语进行提示;(iii) 我们训练了 SAT-Nano(1.1 亿参数)和 SAT-Pro(4.47 亿参数)。SAT-Pro 在 497 个类别上的表现与 72 个 nnU-Nets(针对每个数据集训练的最强专用模型,总参数超过 22 亿)相当。与交互式方法 MedSAM 相比,SAT-Pro 在所有 7 个人体区域均持续表现更优,平均 Dice 相似系数 (DSC) 提升了 +7.1%,同时展现出更强的可扩展性和鲁棒性。在 2 个外部(跨中心)数据集上,SAT-Pro 的性能高于所有基线模型(平均 DSC 提升 +3.7%),证明了其卓越的泛化能力。
引用
@article{arxiv.2312.17183,
title = {Large-Vocabulary Segmentation for Medical Images with Text Prompts},
author = {Ziheng Zhao and Yao Zhang and Chaoyi Wu and Xiaoman Zhang and Xiao Zhou and Ya Zhang and Yanfeng Wang and Weidi Xie},
journal= {arXiv preprint arXiv:2312.17183},
year = {2025}
}
备注
74 pages