中文

MedViLaM:用于医学数据理解与生成的具备优秨泛化性与可解释性的多模态大语言模型

计算机视觉与模式识别 2024-10-01 v1

摘要

医学本质上具有多模态和多任务特性,数据模态种类丰富,涵盖文本、影像等。然而,现有医学领域的大多数模型仅支持单一模态和单一任务,且泛化性和可解释性不足。本研究引入了 MedViLaM,这是一个统一的视觉语言模型,旨在构建用于医学数据的通用模型,能够灵活地对各种形式的医学数据进行编码和解释,包括临床文本与影像,均使用同一套模型权重。为促进此类多任务模型的开发,我们构建了 MultiMedBench,这是一个包含多种不同任务的全方位预训练数据集和基准测试,包括连续问答、多标签疾病分类、疾病定位、放射报告的生成与总结等任务。MedViLaM 在 MultiMedBench 上的所有任务上均表现出色,常常以显著的优势超越其他通用模型。此外,我们还展示了零样本泛化到新医学概念与任务的案例,不同任务之间的有效迁移学习,以及零样本医学推理的出现。

关键词

引用

@article{arxiv.2409.19684,
  title  = {MedViLaM: A multimodal large language model with advanced generalizability and explainability for medical data understanding and generation},
  author = {Lijian Xu and Hao Sun and Ziyu Ni and Hongsheng Li and Shaoting Zhang},
  journal= {arXiv preprint arXiv:2409.19684},
  year   = {2024}
}