中文

LLaVA-UHD:一种感知任意长宽比与高分辨率图像的 LMM

计算机视觉与模式识别 2024-03-19 v1 人工智能

摘要

视觉编码构成了大型多模态模型(LMMs)理解视觉世界的基础。传统 LMMs 以固定尺寸和有限分辨率处理图像,而近期在该方向的探索在自适应性、效率甚至正确性方面存在局限。在本工作中,我们首先以 GPT-4V 和 LLaVA-1.5 为代表性示例,揭示了根植于其视觉编码策略中的系统性缺陷。为应对这些挑战,我们提出了 LLaVA-UHD,一种能够高效感知任意长宽比与高分辨率图像的大型多模态模型。LLaVA-UHD 包含三个关键组件:(1)一种图像模块化策略,将原生分辨率图像划分为更小的可变尺寸切片,以实现高效且可扩展的编码;(2)一个压缩模块,进一步浓缩来自视觉编码器的图像 token;(3)一种空间模式,为 LLM 组织切片 token。综合实验表明,LLaVA-UHD 在 9 个基准测试中优于使用多 2-3 个数量级数据训练的现有 LMMs。值得注意的是,我们基于 LLaVA-1.5 336x336 构建的模型仅使用 94% 的推理计算量即支持 6 倍更大(即 672x1088)分辨率的图像,并在 TextVQA 上取得了 6.4 的准确率提升。此外,该模型可在学术环境下高效训练,在 8 张 A100 GPU 上仅需 23 小时(LLaVA-1.5 需 26 小时)。我们在 https://github.com/thunlp/LLaVA-UHD 公开提供数据与代码。

关键词

引用

@article{arxiv.2403.11703,
  title  = {LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images},
  author = {Ruyi Xu and Yuan Yao and Zonghao Guo and Junbo Cui and Zanlin Ni and Chunjiang Ge and Tat-Seng Chua and Zhiyuan Liu and Maosong Sun and Gao Huang},
  journal= {arXiv preprint arXiv:2403.11703},
  year   = {2024}
}

备注

Preprint