概念到像素:无提示通用医学图像分割
计算机视觉与模式识别
2026-03-19 v1
摘要
通用医学图像分割旨在使用单个基础模型处理多个成像模态中的 diverse 任务。然而,现有方法往往过度依赖手动视觉提示或检索的参考图像,这限制了其自动化和鲁棒性。此外,naive 的跨模态联合训练往往难以处理大的域迁移。在本文中,我们提出了 Concept-to-Pixel (C2P),一种新型无提示通用分割框架。C2P 明确地将解剖知识分解为两个组成部分:几何表示和语义表示。它利用多模态大语言模型 (MLLM) 将抽象的高层医学概念蒸馏到可学习的语义标记,并引入受显式监督的几何标记来强制执行通用的物理和结构约束。这些解缝的标记与图像特征深度交互,以生成用于精确掩码预测的输入特定动态内核。此外,我们引入了几何感知推断共识机制,该机制利用模型预测的几何约束来评估预测可靠性并抑制异常值。在包含七个模态中八个 diverse 数据集的统一基准上进行的大量实验和分析表明,我们的联合训练方法在 universe- 或 single-model 方法方面具有显著优势。值得注意的是,我们的统一模型在 zero-shot 任务中展现出强大的泛化能力,不仅适用于未见情况,还能在类似任务中的跨模态迁移中取得令人印象深刻的结果。代码已公开:https://github.com/Yundi218/Concept-to-Pixel
引用
@article{arxiv.2603.17746,
title = {Concept-to-Pixel: Prompt-Free Universal Medical Image Segmentation},
author = {Haoyun Chen and Fenghe Tang and Wenxin Ma and Shaohua Kevin Zhou},
journal= {arXiv preprint arXiv:2603.17746},
year = {2026}
}
备注
32 pages, code is available at: https://github.com/Yundi218/Concept-to-Pixel