中文

Eagle:探索混合编码器的多模态大语言模型设计空间

计算机视觉与模式识别 2025-03-04 v2 人工智能 机器学习 机器人学

摘要

准确解释复杂视觉信息的能力是多模态大语言模型(MLLMs)的关键课题。近期工作表明,增强的视觉感知显著减少了幻觉,并提高了对分辨率敏感任务(如光学字符识别和文档分析)的性能。许多最近的MLLM通过使用混合视觉编码器来实现这一目标。尽管取得了成功,但在专家选择和多个视觉编码器的集成等关键方面缺乏系统性的比较和详细的消融研究。本研究对使用混合视觉编码器和分辨率的MLLM设计空间进行了广泛的探索。我们的发现揭示了各种现有策略中常见的几个基本原则,从而形成了一种简化而有效的设计方法。我们发现,简单地将来自一组互补视觉编码器的视觉令牌连接起来,与更复杂的混合策略或架构同样有效。我们还引入了预对齐来弥合以视觉为中心的编码器与语言令牌之间的差距,增强了模型的连贯性。由此产生的MLLM家族Eagle在主要MLLM基准测试中超越了其他领先的开源模型。

关键词

引用

@article{arxiv.2408.15998,
  title  = {Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders},
  author = {Min Shi and Fuxiao Liu and Shihao Wang and Shijia Liao and Subhashree Radhakrishnan and Yilin Zhao and De-An Huang and Hongxu Yin and Karan Sapra and Yaser Yacoob and Humphrey Shi and Bryan Catanzaro and Andrew Tao and Jan Kautz and Zhiding Yu and Guilin Liu},
  journal= {arXiv preprint arXiv:2408.15998},
  year   = {2025}
}

备注

Github: https://github.com/NVlabs/Eagle, HuggingFace: https://huggingface.co/NVEagle