中文

LLaVA-UHD v4:什么使得大语言多模态模型中的高效视觉编码成为可能?

计算机视觉与模式识别 2026-05-12 v1

摘要

视觉编码是多模态大语言模型 (MLLMs) 中的主要计算瓶颈,尤其是针对高分辨率图像输入。当前做法通常采用全局编码后跟随后-ViT 压缩。全局编码产生大量标记序列,而后-ViT 压缩在任何标记降低之前都会引发 ViT 的完全二次注意力成本。在本工作中,我们沿两个维度重新审视了这一惯例:编码策略和视觉标记压缩。首先,通过受控实验表明,切片基编码在基准测试中优于全局编码,这表明通过切片视图保留局部细节比对精细感知应用全局注意力更有益。其次,我们引入了 intra-ViT 早期压缩,该方法在浅层 ViT 层中显著降低标记数,从而大幅降低视觉编码 FLOPs,同时保持下游性能。通过将 intra-ViT 压缩集成到切片基编码框架中,我们提出了 LLaVA-UHD v4,一种针对高分辨率输入的高效且可计算控制的视觉编码方案。跨越覆盖文档理解、OCR 和通用 VQA 的多样化基准测试,LLaVA-UHD v4 在视觉编码 FLOPs 上降低了 55.8%,同时在性能上匹配甚至超越基线。这些结果表明,在不牺牲下游性能的前提下,可以显著改进视觉编码效率,为高效高分辨率 MLLMs 提供了实用的设计方向。所有模型权重和代码将公开发布,以支持进一步研究。

关键词

引用

@article{arxiv.2605.08985,
  title  = {LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?},
  author = {Kechen Fang and Yihua Qin and Chongyi Wang and Wenshuo Ma and Tianyu Yu and Yuan Yao},
  journal= {arXiv preprint arXiv:2605.08985},
  year   = {2026}
}