中文

Uni-MoE:利用混合专家扩展统一多模态大语言模型

人工智能 2024-05-21 v1 计算与语言 计算机视觉与模式识别 多媒体

摘要

多模态大语言模型(MLLM)的最新进展强调了可扩展模型和数据对提升性能的重要性,但这通常会导致巨大的计算成本。尽管混合专家(MoE)架构已被用于高效扩展大型语言和图像-文本模型,但这些工作通常涉及较少的专家和有限的模态。为了解决这个问题,我们的工作首次尝试开发具有MoE架构的统一MLLM,名为Uni-MoE,它可以处理多种模态。具体而言,它采用具有连接器的模态特定编码器,用于统一的多模态表示。我们还在LLM内部实现了稀疏MoE架构,通过模态级数据并行和专家级模型并行实现高效训练和推理。为了增强多专家协作和泛化能力,我们提出了一种渐进式训练策略:1)使用不同连接器与不同跨模态数据进行跨模态对齐;2)使用跨模态指令数据训练模态特定专家以激活专家偏好;3)利用低秩适应(LoRA)在混合多模态指令数据上微调Uni-MoE框架。我们在全面的多模态数据集上评估了经过指令微调的Uni-MoE。广泛的实验结果表明,Uni-MoE的主要优势在于显著减少了处理混合多模态数据集时的性能偏差,同时改善了多专家协作和泛化能力。我们的发现强调了MoE框架在推进MLLM方面的巨大潜力,代码可在https://github.com/HITsz-TMG/UMOE-Scaling-Unified-Multimodal-LLMs获取。

关键词

引用

@article{arxiv.2405.11273,
  title  = {Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts},
  author = {Yunxin Li and Shenyuan Jiang and Baotian Hu and Longyue Wang and Wanqi Zhong and Wenhan Luo and Lin Ma and Min Zhang},
  journal= {arXiv preprint arXiv:2405.11273},
  year   = {2024}
}

备注

22 pages, 13 figures. Project Website: https://uni-moe.github.io/. Working in progress