Uni-Med:一种通过Connector-MoE实现多任务学习的统一医用通用基础模型
计算机视觉与模式识别
2024-11-04 v2 人工智能
机器学习
摘要
多模态大语言模型(MLLM)在 various visual and linguistic tasks 上展现出惊人的能力,但在医学领域构建用于多任务学习的统一MLLM仍面临较大的挑战。为缓解MLLM中多模态多任务优化的拉锯问题,近期研究主要关注改进LLM组件,忽略了连接器这一桥接异构模态的关键组件。本文提出Uni-Med,一种新型医用通用基础模型,包含通用视觉特征提取模块、连接器混合专家(CMoE)模块和LLM。凭借所提出的CMoE——通过设计的路由器在连接器处融合多个投影专家,Uni-Med高效解决了拉锯问题,可完成包括问答、视觉问答、报告生成、指代表达理解、指代表达生成和图像分类在内的六种医学任务。到目前为止,Uni-Med是首个在MLLM中针对连接器层面解决多任务干扰的努力。大量消融实验表明,在任意配置下引入CMoE都能带来最高达8%的性能提升。我们进一步从梯度优化和参数统计的角度,对拉锯问题进行解释分析。与以往的SOTA医用MLLM相比,Uni-Med在 diverse tasks 上实现了竞争甚至优异的评估指标。代码和资源已公开于https://github.com/tsinghua-msiip/Uni-Med。
引用
@article{arxiv.2409.17508,
title = {Uni-Med: A Unified Medical Generalist Foundation Model For Multi-Task Learning Via Connector-MoE},
author = {Xun Zhu and Ying Hu and Fanbin Mo and Miao Li and Ji Wu},
journal= {arXiv preprint arXiv:2409.17508},
year = {2024}
}