中文

LLaVA-MoD:通过 MoE 知识蒸馏让 LLaVA 变小

计算机视觉与模式识别 2024-10-24 v3

摘要

我们提出了 LLaVA-MoD,一种 novel 框架,旨在通过从大规模 MLLM 蒸馏知识来高效训练小规模多模态语言模型 (s-MLLM)。我们的做法解决了 MLLM 蒸馏中的两个根本挑战。首先,我们通过将稀疏 Mixture of Experts (MoE) 架构集成到语言模型中来优化 s-MLLM 的网络结构,在计算效率和模型表达能力之间取得平衡。其次,我们提出了渐进式知识转移策略以确保全面知识迁移。该策略首先采用模仿蒸馏,通过最小化输出分布之间的 Kullback-Leibler (KL) 散度来使学生模型模仿教师网络的理解。随后,我们引入通过直接偏好优化 (DPO) 的偏好蒸馈,其中关键在于将 l-MLLM 作为参考模型。在此阶段,s-MLLM 识别优质与劣质示例能力显著提升,远超 l-MLLM,从而产生更好的学生模型,尤其在幻觉基准测试中表现更佳。大量实验表明,LLaVA-MoD 在各种多模态基准测试中均优于现有模型,同时保持最小数量的激活参数和低计算成本。值得注意的是,仅凭 2B 激活参数,LLaVA-MoD 就以平均提升 8.8% 的性能超越 Qwen-VL-Chat-7B,仅使用 0.3% 的训练数据和 23% 的可训练参数。这些结果凸显了 LLaVA-MoD 有效蒸馏教师模型中综合知识的能力,为开发更高效的 MLLM 指明了方向。代码将在 https://github.com/shufangxun/LLaVA-MoD 上公开。

关键词

引用

@article{arxiv.2408.15881,
  title  = {LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation},
  author = {Fangxun Shu and Yue Liao and Le Zhuo and Chenning Xu and Lei Zhang and Guanghao Zhang and Haonan Shi and Long Chen and Tao Zhong and Wanggui He and Siming Fu and Haoyuan Li and Bolin Li and Zhelun Yu and Si Liu and Hongsheng Li and Hao Jiang},
  journal= {arXiv preprint arXiv:2408.15881},
  year   = {2024}
}