中文

面向通用多模态大语言模型的混合专家模型(MoME)

计算机视觉与模式识别 2024-07-18 v1

摘要

多模态大语言模型(MLLM)在 various vision-language 任务上已展现出惊人的能力。然而,通用型 MLLM 在大多数视觉语言任务上均不及专家型 MLLM,这可以归因于任务之间的相互干扰。本文提出一种混合多模态专家(MoME)方案,以缓解任务干扰并构建通用型 MLLM。我们的 MoME 包含两个关键组件:视觉专家混合(MoVE)和语言专家混合(MoLE)。MoVE 可以自适应地调节来自各种视觉编码器的特征,对该方案具有强大的转换架构兼容性。MoLE 将稀疏门控专家引入大语言模型,以几乎不改变推理成本的情况下实现轻松的性能提升。针对任务干扰,我们的 MoME 在视觉和语言两个模态上都进行了专业化,以适应任务之间的差异。大量实验表明,MoME 在 various 视觉语言任务上显著提升了通用型 MLLM 的性能。源码已发布于 https://github.com/JiuTian-VL/MoME

关键词

引用

@article{arxiv.2407.12709,
  title  = {MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models},
  author = {Leyang Shen and Gongwei Chen and Rui Shao and Weili Guan and Liqiang Nie},
  journal= {arXiv preprint arXiv:2407.12709},
  year   = {2024}
}

备注

Github: https://github.com/JiuTian-VL/MoME