中文

LLaVA-MoLE:用于缓解指令微调多模态大语言模型中数据冲突的稀疏LoRA专家混合

计算机视觉与模式识别 2024-01-31 v2

摘要

对多种图像-文本指令数据进行指令微调是获取通用多模态大语言模型(MLLM)的关键,而不同的指令数据配置会导致微调后模型具有不同的能力。然而,我们发现,当将来自不同领域的指令数据混合时,数据冲突是不可避免的,这会导致特定领域任务性能下降。为解决此问题,我们提出应用一种高效的专家混合(MoE)设计,即稀疏LoRA专家混合(MoLE)用于指令微调MLLM。在Transformer层中,我们扩展流行的低秩适应(LoRA)方法,通过为MLP层创建一组LoRA专家,并基于路由函数将每个token路由到前1个专家,以实现来自不同领域的token的自适应选择。由于LoRA专家是稀疏激活的,训练和推理成本与原始LoRA方法基本保持恒定。通过替换LLaVA-1.5的普通LoRA,我们的最终模型命名为LLaVA-MoLE。大量实验表明,LLaVA-MoLE在混合多个具有不同配置的指令数据集时有效缓解了数据冲突问题,并在强大的普通LoRA基线上实现持续的性能提升。最重要的是,在混合数据集上,LLaVA-MoLE甚至可以超过使用两倍样本的普通LoRA基线。

关键词

引用

@article{arxiv.2401.16160,
  title  = {LLaVA-MoLE: Sparse Mixture of LoRA Experts for Mitigating Data Conflicts in Instruction Finetuning MLLMs},
  author = {Shaoxiang Chen and Zequn Jie and Lin Ma},
  journal= {arXiv preprint arXiv:2401.16160},
  year   = {2024}
}