中文

MedMO:面向医学图像的多模态大语言模型基座模型

计算机视觉与模式识别 2026-03-13 v2

摘要

多模态大语言模型(MLLM)已取得快速进展,但在医疗领域的采用受限于领域覆盖不足、模态对齐不完善以及缺乏扎实推理。我们引入 MedMO,一个基于通用 MLLM 架构构建的医学多模态基座模型,仅使用大规模领域特定数据进行训练。MedMO 采用多阶段训练流程,包括跨模态预训练以对齐异构视觉编码器与医学语言骨干网络、包含描述、VQA、报告生成、检索及边界框疾病定位等多任务监督的指令调优,以及结合事实性检查与盒级 GIoU 信号的强化学习,以提升挑战性临床场景下的空间定位和分步推理。跨模态与任务,MedMO 超越了强大的开源医学基准。MedMO-8B-Next 在 VQA 基准上实现持续提升,平均超过 Fleming-VL-8B 提升 6.6%,包括 MMMU-Med 提升 6.0%、PMC-VQA 提升 9.8%、MedXpertQA 提升 21.3%。在文本-based QA 上提升 14.4%,驱动 MMLU-Med 提升 8.4%、MedQA 提升 30.1%。医学报告生成方面提升 6.7%。MedMO-8B-Next 还表现出强大的定位性能,在 Bacteria 上达到 56.1 IoU,超越 Fleming-VL-8B 47.8 IoU。规模更小的 MedMO-4B-Next 同样具竞争力,超越 Fleming-VL-8B 在 VQA、QA 与报告生成方面。覆盖放射学、眼科与病理显微镜的评估进一步证明其广泛的跨模态泛化能力。项目地址: https://genmilab.github.io/MedMO-Page

关键词

引用

@article{arxiv.2602.06965,
  title  = {MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images},
  author = {Ankan Deria and Komal Kumar and Adinath Madhavrao Dukre and Eran Segal and Salman Khan and Imran Razzak},
  journal= {arXiv preprint arXiv:2602.06965},
  year   = {2026}
}

备注

21 pages, 6 figures and 4 tables