基于模态提示的轻量级医学分段模型:MCP-MedSAM
计算机视觉与模式识别
2025-07-23 v3
摘要
医学图像分段涉及将医学图像划分为有意义的区域,旨在识别解剖结构和病灶。该任务在医疗保健领域具有广泛应用前景,深度学习方法已为自动化这一过程带来了显著进展。最近,分段模型(SAM)的出现——首个针对分段任务的基础模型——促使研究人员将其适用于医疗领域以提升在各种任务上的性能。然而,SAM的大型模型规模和高GPU需求阻碍了其在医疗领域的可扩展性和开发。本文提出MCP-MedSAM,一种强大且轻量级的医学SAM模型,旨在在单块40GB内存的A100 GPU上用一天时间进行训练,同时实现卓越的分段性能。鉴于模态之间存在显著内部差异以及对在边界框内直接获取分段目标信息的需求,我们引入两种类型的提示:模态提示和内容提示。经过提示编码器处理后,它们的嵌入表示可进一步通过无需增加显著训练开销的方式提高分段性能。此外,我们采用有效的基于模态的数据抽样策略以解决模态之间的数据不平衡问题,确保所有模态的性能更加均衡。我们使用大规模挑战数据集对该方法进行训练和评估,与挑战评分榜上顶尖方法相比,MCP-MedSAM在仅用单GPU一天训练的情况下实现了优异性能。代码已公开available at \textcolor{blue}{https://github.com/dong845/MCP-MedSAM}。
引用
@article{arxiv.2412.05888,
title = {MCP-MedSAM: A Powerful Lightweight Medical Segment Anything Model Trained with a Single GPU in Just One Day},
author = {Donghang Lyu and Ruochen Gao and Marius Staring},
journal= {arXiv preprint arXiv:2412.05888},
year = {2025}
}
备注
Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA)