面向医疗领域的像素级洞察多模态大语言模型研究
计算机视觉与模式识别
2025-10-09 v3 人工智能
摘要
近年来,多模态大语言模型(MLLM)取得了显著进展,展示了开发智能医疗助手的可行性。然而,当前医疗领域的 MLLM 主要聚焦于图像级理解,仅限于文本指令交互,限制了其能力边界和使用灵活性。本文介绍了一种新颖的医疗领域 end-to-end 多模态大语言模型,名为 MedPLIB,具备像素级理解能力。令人兴奋的是,它支持视觉问答(VQA)、任意像素级提示(点、边界框和自由形式图形)以及像素级定位。我们提出了一种新颖的混合专家(MoE)多阶段训练策略,将 MoE 分解为视觉语言专家模型和像素定位专家模型的独立训练阶段,然后进行 MoE 微调。该策略有效协调多任务学习,同时保持推理阶段单一专家模型的计算成本。为推动医疗 MLLM 研究,本文引入了医疗复杂视觉问答数据集(MeCoVQA),包含 8 种模态,用于复杂医学影像问答和图像区域理解。实验结果表明,MedPLIB 在多项医学视觉语言任务上取得了最新进展。更重要的是,在像素级定位任务的零样态评估中,MedPLIB 分别在 mDice 指标上领先当前最小和最大模型 19.7 和 15.6 的比例。代码、数据和模型检查点将发布于 https://github.com/ShawnHuang497/MedPLIB。
关键词
引用
@article{arxiv.2412.09278,
title = {Towards a Multimodal Large Language Model with Pixel-Level Insight for Biomedicine},
author = {Xiaoshuang Huang and Lingdong Shen and Jia Liu and Fangxin Shang and Hongxiang Li and Haifeng Huang and Yehui Yang},
journal= {arXiv preprint arXiv:2412.09278},
year = {2025}
}
备注
Accepted by AAAI2025