Med-MoE:面向轻量级医学视觉-语言模型的领域特定专家混合
计算机视觉与模式识别
2024-09-04 v3 计算与语言
摘要
近期,通用或领域特定的多模态大语言模型(LLMs)在医学决策方面取得了显著进展。然而,它们被指定用于特定的分类或生成任务,并且需要在大规模数据集上进行模型训练或微调,参数规模庞大,计算量巨大,这阻碍了它们在实践中各种资源受限场景下的临床应用。在本文中,我们提出了一个新颖且轻量级的框架Med-MoE(专家混合),该框架可处理判别式和生成式多模态医学任务。Med-MoE的学习包括三个步骤:多模态医学对齐、指令微调与路由、以及领域特定的MoE微调。在将多模态医学图像与LLM词元对齐后,我们通过指令微调使模型能够处理不同的多模态医学任务,同时配备一个可训练的路由器,用于跨输入模态的专家选择。最后,通过将路由器与多个领域特定专家集成来微调模型,这些专家被选择性激活,并由元专家进一步增强。在VQA-RAD、SLAKE和Path-VQA等数据集上进行的开放式和封闭式医学视觉问答(Med-VQA)以及图像分类任务的综合实验表明,我们的模型能够达到与最先进基线相当或更优的性能,同时仅需激活约30%-50%的模型参数。广泛的分析和消融研究证实了我们方法的有效性和实际效用。
引用
@article{arxiv.2404.10237,
title = {Med-MoE: Mixture of Domain-Specific Experts for Lightweight Medical Vision-Language Models},
author = {Songtao Jiang and Tuo Zheng and Yan Zhang and Yeying Jin and Li Yuan and Zuozhu Liu},
journal= {arXiv preprint arXiv:2404.10237},
year = {2024}
}