Medal S:面向医学分割的空间-文本提示模型
摘要
我们介绍 Medal S,这是一个支持原生分辨率空间和文本提示的医学分割基础模型,能够在 end-to-end 可训练框架中实现。与仅基于文本的方法不同,Medal S 在体积化提示和文本嵌入之间实现了通道级对齐,从而缓解了分辨率不匹配导致的误差。通过保持完整的 3D 上下文,Medal S 能够高效地并行处理多个原生分辨率掩码,提高了多类分割性能。一个轻量级 3D 卷积模块支持基于两种提示类型的体素空间精细调整,支持来自 CT、MRI、PET、超声和显微镜等模态的 BiomedSegFM 数据集中的最高 243 类。Medal S 提供两种提示模式:一种是 text-only 模式,其中模型预测作为空间提示用于自我精炼,无需人工输入;另一种是混合模式,整合人工标注以实现更灵活的控制。对于 24 类分割,平行空间提示比顺序提示缩短推理时间超过 90%。我们提出动态抽样以解决目标-patch 比例不平衡问题,扩展了 SAT 和 nnU-Net 的数据增强。此外,我们开发了优化的文本预处理、两个阶段的推理策略和后处理技术,以提高内存效率、精度和推理速度。在该数据集的五个模态平均验证集上,Medal S 的 DSC 达到 75.44(相对于 69.83),NSD 达到 77.34(相对于 71.06),F1 达到 38.24(相对于 24.88),DSC TP 达到 65.46(相对于 46.97)。Medal S 通过将空间精度与语义文本指导和谐,展示了在多类医学分割任务中相对于顺序提示方法的卓越效率和准确性。Medal S 将在 https://github.com/yinghemedical/Medal-S 上公开发布。
引用
@article{arxiv.2511.13001,
title = {Medal S: Spatio-Textual Prompt Model for Medical Segmentation},
author = {Pengcheng Shi and Jiawei Chen and Jiaqi Liu and Xinglin Zhang and Tao Chen and Lei Li},
journal= {arXiv preprint arXiv:2511.13001},
year = {2025}
}
备注
Accepted by CVPR 2025 Workshop MedSegFM