K-Prism:知识引导与提示集成的通用医学图像分割模型
计算机视觉与模式识别
2025-10-01 v1 人工智能
摘要
医学图像分割是临床决策的基础,但现有模型仍然碎片化。它们通常基于单一知识源训练,且针对特定任务、模态或器官。这种碎片化与临床实践形成鲜明对比,在临床实践中,专家能够无缝整合多样化的知识:来自训练的解剖先验、来自参考案例的基于示例的推理,以及通过实时交互进行的迭代优化。我们提出了K-Prism,一个统一的分割框架,通过系统整合三种知识范式来镜像这种临床灵活性:(i)从标注数据集中学习的语义先验,(ii)来自少样本参考示例的上下文知识,以及(iii)来自用户输入(如点击或涂鸦)的交互反馈。我们的关键洞察是,这些异构知识源可以编码为双提示表示:1-D稀疏提示定义分割什么,2-D密集提示指示关注哪里,然后通过专家混合(MoE)解码器动态路由。这种设计使得在不同范式之间灵活切换,并支持跨多样化任务的联合训练而无需修改架构。在涵盖多种模态(CT、MRI、X光、病理、超声等)的18个公开数据集上的全面实验表明,K-Prism在语义分割、上下文分割和交互式分割设定中均达到了最先进的性能。代码将在发布时公开。
引用
@article{arxiv.2509.25594,
title = {K-Prism: A Knowledge-Guided and Prompt Integrated Universal Medical Image Segmentation Model},
author = {Bangwei Guo and Yunhe Gao and Meng Ye and Difei Gu and Yang Zhou and Leon Axel and Dimitris Metaxas},
journal= {arXiv preprint arXiv:2509.25594},
year = {2025}
}