CuMo: 基于共升级混合专家的多模态 LLM 规模化
计算机视觉与模式识别
2024-05-10 v1
摘要
最近的多模态大型语言模型 (LLM) 进展主要集中在通过增加文本-图像配对数据和增强 LLM 以提高其在多模态任务上的性能方面进行规模化。然而, 这些规模化方法计算代价高昂, 忽视了从视觉侧提升模型能力的重要性。灵感来源于 Mixture-of-Experts (MoE) 在 LLM 中的成功应用, 该方法在训练时提高模型可扩展性, 而推理成本与小型模型相似, 我们提出了 CuMo。CuMo 将共升级 Top-K 稀疏门控 Mixture-of-Experts 块集成到视觉编码器和 MLP 连接器中, 从而以最小的额外激活参数提升多模态 LLM。CuMo 在预训练阶段首先训练 MLP 块, 然后在视觉指令调优阶段从预训练的 MLP 块初始化每个 MoE 专家。采用辅助损失以确保专家负载均衡。CuMo 在各种 VQA 和视觉指令跟随基准测试中均优于每组模型规模内的最新多模态 LLM, 且仅使用开源数据集进行训练。CuMo 的代码和模型权重已开源于 https://github.com/SHI-Labs/CuMo。
引用
@article{arxiv.2405.05949,
title = {CuMo: Scaling Multimodal LLM with Co-Upcycled Mixture-of-Experts},
author = {Jiachen Li and Xinyao Wang and Sijie Zhu and Chia-Wen Kuo and Lu Xu and Fan Chen and Jitesh Jain and Humphrey Shi and Longyin Wen},
journal= {arXiv preprint arXiv:2405.05949},
year = {2024}
}