CAT:协调解剖-文本提示用于多器官和肿瘤分割
计算机视觉与模式识别
2024-11-01 v2
摘要
医学影像领域中现有的可提示分割方法主要考虑文本或视觉提示来分割相关对象,但在处理医学图像中的异常(如肿瘤)时往往表现不佳,这些异常在形状、大小和外观上可能差异很大。认识到医学场景的复杂性以及文本或视觉提示的局限性,我们提出了一种新颖的双提示模式,利用视觉和文本提示的互补优势来分割各种器官和肿瘤。具体来说,我们引入了CAT,一个创新的模型,它协调了从3D裁剪图像中获得的解剖提示与由医学领域知识丰富的文本提示。模型架构采用通用的基于查询的设计,其中提示查询促进用于掩码预测的分割查询。为了在统一框架内协同两种类型的提示,我们实现了一个共享精炼器(ShareRefiner),它在分离两种提示的同时精炼分割查询和提示查询。在由10个公共CT数据集组成的联合体上训练后,CAT在多个分割任务中展现出优越的性能。在专门的内部数据集上的进一步验证揭示了其跨多个癌症阶段分割肿瘤的卓越能力。该方法证实了协调多模态提示是解决医学领域复杂场景的一个有前景的途径。
引用
@article{arxiv.2406.07085,
title = {CAT: Coordinating Anatomical-Textual Prompts for Multi-Organ and Tumor Segmentation},
author = {Zhongzhen Huang and Yankai Jiang and Rongzhao Zhang and Shaoting Zhang and Xiaofan Zhang},
journal= {arXiv preprint arXiv:2406.07085},
year = {2024}
}