中文

Octavius:通过 LoRA-MoE 缓解 MLLM 中的任务干扰

计算机视觉与模式识别 2024-11-26 v3 计算与语言

摘要

近期研究表明,大语言模型(LLMs)可通过指令微调将其零样本泛化能力扩展到多模态学习。随着更多模态与下游任务的引入,负面冲突与干扰可能对性能产生更糟糕的影响。尽管这一现象在先前工作中被忽视,我们提出了一种新颖且可扩展的框架,称为 Octavius,用于对多模态大语言模型(MLLMs)的多模态学习进行全面研究与实验。具体而言,我们结合了著名的混合专家(MoE)与代表性 PEFT 技术之一 LoRA,设计了一种用于多模态学习的基于 LLM 的新型解码器,称为 LoRA-MoE。据我们所知,我们是率先将 MoE 引入 MLLM 以解决此问题的努力之一。实验结果(约 20% 的提升)显示了我们的设计在各种 2D 与 3D 下游任务中的有效性与通用性。代码与数据集可在 https://openlamm.github.io/tutorial/ 获取。

关键词

引用

@article{arxiv.2311.02684,
  title  = {Octavius: Mitigating Task Interference in MLLMs via LoRA-MoE},
  author = {Zeren Chen and Ziqin Wang and Zhen Wang and Huayang Liu and Zhenfei Yin and Si Liu and Lu Sheng and Wanli Ouyang and Yu Qiao and Jing Shao},
  journal= {arXiv preprint arXiv:2311.02684},
  year   = {2024}
}

备注

22 pages, 12 figures. Accepted in ICLR 2024