中文

LEO-MINI:一种基于条件标记减少和多模态专家混合的高效多模态大语言模型

计算机视觉与模式识别 2025-09-23 v2 计算与语言

摘要

多模态大语言模型(MLLMs)中视觉标记的冗余显著降低了计算效率。最近的一些方法,如重采样器和汇总器,试图减少视觉标记的数量,但以牺牲视觉推理能力为代价。为此,我们提出了 LEO-MINI,一种新型 MLLM,可显著减少视觉标记的数量,同时提升视觉推理能力。为提高效率,LEO-MINI 包含 CoTR(条件标记减少模块),用于通过视觉标记、文本标记及紧凑可学习查询之间的相似性,将大量视觉标记整合为更少的标记。为提高效果,为最小化计算开销,LEO-MINI 采用 MMoE(多模态专家混合模块)。MMoE 使用一组 LoRA 专家,配合新颖的路由器,根据输入文本和视觉标记进行切换,而不仅仅是依据输入隐藏状态。MMoE 还包括一个总体 LoRA 专家,始终被激活以学习通用知识以进行 LLM 推理。为提取更丰富的视觉特征,MMoE 使用一组在多样化领域特定数据上训练的视觉专家。为展示 LEO-MINI 在效率和性能方面的改进,我们在各种视觉语言任务基准上对其进行评估,评估对象包括现有的高效 MLLM。

关键词

引用

@article{arxiv.2504.04653,
  title  = {LEO-MINI: An Efficient Multimodal Large Language Model using Conditional Token Reduction and Mixture of Multi-Modal Experts},
  author = {Yimu Wang and Mozhgan Nasr Azadani and Sean Sedwards and Krzysztof Czarnecki},
  journal= {arXiv preprint arXiv:2504.04653},
  year   = {2025}
}

备注

To appear at EMNLP 2025