MoE-LLaVA:面向大型视觉语言模型的混合专家
计算机视觉与模式识别
2024-12-24 v5
摘要
最近的进展表明,扩展大型视觉语言模型(LVLMs)可有效提升下游任务性能。然而,现有的扩展方法在计算过程中会为每个 token 激活所有模型参数,这带来了巨大的训练和推理成本。在这项工作中,我们为 LVLMs 提出了一种简单而有效的训练策略 MoE-Tuning。该策略创新性地解决了多模态稀疏学习中性能下降的常见问题,从而构建了一个具有庞大参数量但计算成本恒定的稀疏模型。此外,我们提出了 MoE-LLaVA,一种基于 MoE 的稀疏 LVLM 架构,它在部署期间通过路由器仅激活 top-k 专家,保持其余专家处于非激活状态。大量实验表明,MoE-LLaVA 在各种视觉理解和物体幻觉基准测试中表现出显著的性能。值得注意的是,仅使用约 3B 稀疏激活参数,MoE-LLaVA 在各种视觉理解数据集上表现出与 LLaVA-1.5-7B 相当的性能,甚至在物体幻觉基准测试中超越了 LLaVA-1.5-13B。通过 MoE-LLaVA,我们旨在为稀疏 LVLMs 建立一个基线,并为未来开发更高效、更有效的多模态学习系统提供有价值的见解。代码发布于 https://github.com/PKU-YuanGroup/MoE-LLaVA。
引用
@article{arxiv.2401.15947,
title = {MoE-LLaVA: Mixture of Experts for Large Vision-Language Models},
author = {Bin Lin and Zhenyu Tang and Yang Ye and Jinfa Huang and Junwu Zhang and Yatian Pang and Peng Jin and Munan Ning and Jiebo Luo and Li Yuan},
journal= {arXiv preprint arXiv:2401.15947},
year = {2024}
}
备注
update author