重思虑多模态 LLM 中视觉编码器混合范式以提升视觉理解
计算机视觉与模式识别
2026-03-09 v2 计算与语言
摘要
混合视觉编码器 (MoVE) 已成为增强多模态大型语言模型 (MLLM) 精细视觉理解的强大方法,提升其处理复杂光学字符识别和场景理解等任务的能力。尽管如此,有效组合多样编码器及其视觉标记,同时扩展到高分辨率输入,仍是一个开放挑战。本文我们系统研究了 MoVE-based MLLM 的融合设计,突显了跨互补编码器在标记层面集成的原则。我们的研究表明,由后适应融合、独立投影器、块级序列交错和全局语境的动态砖块组成的轻量配方,可在多样化基准上实现卓越性能。我们将这些原则集成到一种简单有效的架构中称为 LEO。广泛评估表明,LEO 在多数任务上均优于现有基于 MoVE 的方法。此外,LEO 能够有效适应自动驾驶领域,无需更改其架构或训练配方,即可实现与既定基准相当的性能,从而凸显了其泛化能力。代码已提供。
关键词
引用
@article{arxiv.2501.06986,
title = {Rethinking the Mixture of Vision Encoders Paradigm for Enhanced Visual Understanding in Multimodal LLMs},
author = {Mozhgan Nasr Azadani and James Riddell and Sean Sedwards and Krzysztof Czarnecki},
journal= {arXiv preprint arXiv:2501.06986},
year = {2026}
}
备注
Accepted by TMLR