中文

EE-MLLM:一种数据高效且计算高效的多模态大语言模型

计算机视觉与模式识别 2025-04-08 v3

摘要

近期在多模态大语言模型(MLLMs)方面的进展在 various vision-language 任务中展现了令人满意的性能。当前用于视觉和语言交互的方法分为两类:基于自注意力和基于交叉注意力。然而,这两种方法都存在内在局限性,导致数据效率和计算效率之间权衡。为解决此问题,我们提出数据-\textbf{E}fficient and Compute-\textbf{E}fficient \textbf{MLLM}(\textbf{EE-MLLM})。具体而言,我们将 MLLM 中的原始自注意力机制修改为一种复合注意力机制。该机制具有两个关键特征:1)消除视觉 token 之间自注意力的计算开销,以实现 \textbf{计算效率},以及2)复用每个 LLM 层的权重,以促进视觉-语言模态对齐,从而实现 \textbf{数据效率}。结果表明,EE-MLLM 在有限训练数据下显著优于 Flamingo,并将 H800 GPU 上的预填充时间缩短至 79 毫秒(相较于 LLaVA 的 277 毫秒)。为进一步探讨 EE-MLLM 的效率,我们提出一种无训练变体 EE-MLLM-F,通过消除基于自注意力的方法的计算成本而无需额外训练。实验结果表明,EE-MLLM 在包括 MMBench 和 SeedBench 等通用数据集,以及 TextVQA 和 DocVQA 等细粒度任务等多个基准上均表现有效。

关键词

引用

@article{arxiv.2408.11795,
  title  = {EE-MLLM: A Data-Efficient and Compute-Efficient Multimodal Large Language Model},
  author = {Feipeng Ma and Yizhou Zhou and Zheyu Zhang and Shilin Yan and Hebei Li and Zilong He and Siying Wu and Fengyun Rao and Yueyi Zhang and Xiaoyan Sun},
  journal= {arXiv preprint arXiv:2408.11795},
  year   = {2025}
}