中文

面向多模态医学图像的轻量级大型视觉语言模型

计算机视觉与模式识别 2025-04-09 v1 机器学习

摘要

医学图像视觉问答(VQA)通过使系统能够解释医学图像并回答临床查询来增强临床决策。然而,由于医学图像的复杂性和多样化模态,开发高效、高性能的VQA模型具有挑战性。本文引入了集成BiomedCLIP进行图像特征提取和LLaMA-3进行文本处理的轻量级多模态VQA模型。针对医学VQA任务设计,本模型在OmniMedVQA数据集上实现了最先进的性能。模型约为80亿参数,仅需两块40GB A100 GPU即可运行,显示出超过大型模型的优异效率。我们的结果显示,开放-ended问题的准确率为73.4%,超越现有模型,验证了其在现实医疗应用中的潜力。关键贡献包括专门的多模态VQA模型、资源高效的架构以及在回答开放式临床问题方面的卓越性能。

关键词

引用

@article{arxiv.2504.05575,
  title  = {A Lightweight Large Vision-language Model for Multimodal Medical Images},
  author = {Belal Alsinglawi and Chris McCarthy and Sara Webb and Christopher Fluke and Navid Toosy Saidy},
  journal= {arXiv preprint arXiv:2504.05575},
  year   = {2025}
}

备注

10 pages, 4 figures