中文

基于基础模型的视觉-语言语义聚合:通用医学图像分割

计算机视觉与模式识别 2025-09-11 v1

摘要

虽然多模态模型在自然图像分割中取得了显著成功,但在医学领域往往表现不佳。通过大量研究,我们将性能差距归因于多模态融合的挑战,主要包括抽象文本提示与细粒度医学视觉特征之间的显著语义鸿沟,以及由此导致的特征离散。为此,我们从语义聚合的角度重新审视问题。具体而言,我们提出了一种期望最大化( EM)聚合机制和文本引导的像素解码器。前者通过动态聚类特征到紧凑的语义中心来缓解特征离散,增强跨模态对应关系;后者则利用领域不变的文本知识有效指导深层视觉表征。两种机制的协同作用显著提升了模型的泛化能力。在公共心脏和视网膜数据集上进行的大量实验表明,我们的方法在多个领域泛化基准上 consistently 超过现有SOTA方法。

关键词

引用

@article{arxiv.2509.08570,
  title  = {Vision-Language Semantic Aggregation Leveraging Foundation Model for Generalizable Medical Image Segmentation},
  author = {Wenjun Yu and Yinchen Zhou and Jia-Xuan Jiang and Shubin Zeng and Yuee Li and Zhong Wang},
  journal= {arXiv preprint arXiv:2509.08570},
  year   = {2025}
}

备注

29 pages and 8 figures