中文

Awaker2.5-VL:基于参数高效专家混合稳定扩展多模态大语言模型

计算机视觉与模式识别 2024-11-19 v1

摘要

随着多模态大语言模型(MLLMs)研究的普及,先进的 MLLM 通常需要同时处理各种文本和视觉任务(如 VQA、检测、OCR 和 ChartQA)以适应现实应用。然而,由于来自不同任务的数据在表示和分布上存在显著差异,简单地将所有任务的数据混合在一起会导致众所周知的“多任务冲突”问题,造成各任务性能下降。为解决这一问题,我们提出了 Awaker2.5-VL,一种适用于 MLLM 的专家混合(MoE)架构,通过多个稀疏激活的专家获取多任务能力。为加速 Awaker2.5-VL 的训练和推理,我们将模型中的每个专家设计为低秩适应(LoRA)结构。在多个最新基准上的大量实验证明了 Awaker2.5-VL 的有效性。代码和模型权重已在项目页面发布:https://github.com/MetabrainAGI/Awaker。

关键词

引用

@article{arxiv.2411.10669,
  title  = {Awaker2.5-VL: Stably Scaling MLLMs with Parameter-Efficient Mixture of Experts},
  author = {Jinqiang Long and Yanqi Dai and Guoxing Yang and Hongpeng Lin and Nanyi Fei and Yizhao Gao and Zhiwu Lu},
  journal= {arXiv preprint arXiv:2411.10669},
  year   = {2024}
}