中文

Uni-Med:一种通过Connector-MoE实现多任务学习的统一医用通用基础模型

计算机视觉与模式识别 2024-11-04 v2 人工智能 机器学习

摘要

多模态大语言模型(MLLM)在 various visual and linguistic tasks 上展现出惊人的能力,但在医学领域构建用于多任务学习的统一MLLM仍面临较大的挑战。为缓解MLLM中多模态多任务优化的拉锯问题,近期研究主要关注改进LLM组件,忽略了连接器这一桥接异构模态的关键组件。本文提出Uni-Med,一种新型医用通用基础模型,包含通用视觉特征提取模块、连接器混合专家(CMoE)模块和LLM。凭借所提出的CMoE——通过设计的路由器在连接器处融合多个投影专家,Uni-Med高效解决了拉锯问题,可完成包括问答、视觉问答、报告生成、指代表达理解、指代表达生成和图像分类在内的六种医学任务。到目前为止,Uni-Med是首个在MLLM中针对连接器层面解决多任务干扰的努力。大量消融实验表明,在任意配置下引入CMoE都能带来最高达8%的性能提升。我们进一步从梯度优化和参数统计的角度,对拉锯问题进行解释分析。与以往的SOTA医用MLLM相比,Uni-Med在 diverse tasks 上实现了竞争甚至优异的评估指标。代码和资源已公开于https://github.com/tsinghua-msiip/Uni-Med。

关键词

引用

@article{arxiv.2409.17508,
  title  = {Uni-Med: A Unified Medical Generalist Foundation Model For Multi-Task Learning Via Connector-MoE},
  author = {Xun Zhu and Ying Hu and Fanbin Mo and Miao Li and Ji Wu},
  journal= {arXiv preprint arXiv:2409.17508},
  year   = {2024}
}