中文

面向多样化医疗任务的可解释双语多模态大语言模型

计算机视觉与模式识别 2025-04-08 v4

摘要

已开发出Several医疗Multimodal Large Language Models (MLLMs)以解决涉及带文字指令的视觉图像的医学任务,取得了令人印象的成绩。目前大多数医学通用模型是区域不可感知的,将整个图像视为整体表示。然而,他们难以在生成句子时识别具体聚焦的区域。为了模仿医生通常先审阅整个图像再集中注意力于特定区域进行深入评估的行为,我们旨在增强医学 MLLMs 在理解整个医学扫描中解剖区域方面的能力。为此,我们首先构建区域中心任务,并构建大型数据集 MedRegInstruct 以纳入区域信息进行训练。将我们收集的数据集与其他医学多模态语料联合训练,我们提出了一种区域感知型医学 MLLM,MedRegA,这是首个能够同时处理图像级和区域级医学视觉语言任务的双语通用医学 AI 系统。我们的 MedRegA 不仅使能三种区域中心任务,还在视觉问答、报告生成和医学图像分类等8种模态上实现最佳性能,展现出显著的多功能性。实验表明,我们的模型不仅在双语设置下能够完成各种医学视觉语言任务的强大性能,还能识别和检测多模态医学扫描中的结构,显著提升了医学 MLLMs 的可解释性和用户交互性。我们的项目页面为 https://medrega.github.io。

关键词

引用

@article{arxiv.2410.18387,
  title  = {Interpretable Bilingual Multimodal Large Language Model for Diverse Biomedical Tasks},
  author = {Lehan Wang and Haonan Wang and Honglong Yang and Jiaji Mao and Zehong Yang and Jun Shen and Xiaomeng Li},
  journal= {arXiv preprint arXiv:2410.18387},
  year   = {2025}
}

备注

Accepted in ICLR 2025