MoME:面向医学影像分割的视觉语言医学专家混合模型
计算机视觉与模式识别
2025-11-03 v1
摘要
本研究提出MoME——一种视觉语言医学专家混合模型,用于医学影像分割。MoME借鉴了大型语言模型(LLMs)中广泛应用的专家混合(Mixture of Experts, MoE)范式,应用于医学视觉语言任务。该架构通过有效利用针对医学影像细节而设计的多尺度视觉特征,结合文本嵌入,实现动态专家选择。本工作探索了视觉语言模型在该领域的新型集成。利用包含3,410例CT扫描的10个数据集组成的 assembly,MoME在全面的医学影像分割基准测试中表现出色。我们的方案探索了以基础模型为医学影像集成,受益于MoE在提升模型性能方面的既有效能,通过纳入文本信息实现。展现出在多个数据集上的竞争精度,MoME探索了一种实现医学图像分析稳健结果的新型架构。
引用
@article{arxiv.2510.26996,
title = {MoME: Mixture of Visual Language Medical Experts for Medical Imaging Segmentation},
author = {Arghavan Rezvani and Xiangyi Yan and Anthony T. Wu and Kun Han and Pooya Khosravi and Xiaohui Xie},
journal= {arXiv preprint arXiv:2510.26996},
year = {2025}
}