中文

MoME:面向医学影像分割的视觉语言医学专家混合模型

计算机视觉与模式识别 2025-11-03 v1

摘要

本研究提出MoME——一种视觉语言医学专家混合模型,用于医学影像分割。MoME借鉴了大型语言模型(LLMs)中广泛应用的专家混合(Mixture of Experts, MoE)范式,应用于医学视觉语言任务。该架构通过有效利用针对医学影像细节而设计的多尺度视觉特征,结合文本嵌入,实现动态专家选择。本工作探索了视觉语言模型在该领域的新型集成。利用包含3,410例CT扫描的10个数据集组成的 assembly,MoME在全面的医学影像分割基准测试中表现出色。我们的方案探索了以基础模型为医学影像集成,受益于MoE在提升模型性能方面的既有效能,通过纳入文本信息实现。展现出在多个数据集上的竞争精度,MoME探索了一种实现医学图像分析稳健结果的新型架构。

关键词

引用

@article{arxiv.2510.26996,
  title  = {MoME: Mixture of Visual Language Medical Experts for Medical Imaging Segmentation},
  author = {Arghavan Rezvani and Xiangyi Yan and Anthony T. Wu and Kun Han and Pooya Khosravi and Xiaohui Xie},
  journal= {arXiv preprint arXiv:2510.26996},
  year   = {2025}
}