MedM-VL:什么才是良好的医学多模态大语言模型?
计算机视觉与模式识别
2025-09-15 v3
摘要
医学图像分析是现代医疗保健的关键环节。深度学习将研究重点转向复杂的医学多模态任务,包括报告生成和视觉问答。传统的任务特定模型在处理这些挑战方面往往不足。大型视觉语言模型 (LVLMs) 为解决此类任务提供了新方案。本研究基于流行的 LLaVA 框架,系统探索 2D 和 3D 医学 LVLMs 的模型架构和训练策略。我们呈现出大量实证发现和实用指导。为支持可重复性和未来研究,我们发布了一个模块化代码库 MedM-VL,以及两个预训练模型:用于 2D 医学图像分析的 MedM-VL-2D,以及用于 3D CT 应用的 MedM-VL-CT-Chest。代码地址:https://github.com/MSIIP/MedM-VL
引用
@article{arxiv.2504.04323,
title = {MedM-VL: What Makes a Good Medical LVLM?},
author = {Yiming Shi and Shaoshuai Yang and Xun Zhu and Haoyu Wang and Xiangling Fu and Miao Li and Ji Wu},
journal= {arXiv preprint arXiv:2504.04323},
year = {2025}
}