中文

LLaVA-UHD v2: 通过分层窗口Transformer集成高分辨率语义金字塔的多模态大语言模型

计算机视觉与模式识别 2025-03-20 v2

摘要

视觉Transformer(ViT)被广泛用于多模态大语言模型(MLLM)中的视觉编码。然而,它们在细粒度视觉感知任务上表现不佳。我们将此归因于ViT在捕获多样化的多模态视觉层次(如低级细节)方面的局限性。为了解决这个问题,我们提出了LLaVA-UHD v2,一个具有先进感知能力的MLLM,通过引入精心设计的视觉-语言投影器——分层窗口(Hiwin)Transformer。Hiwin Transformer通过整合我们构建的高分辨率语义金字塔,增强了MLLM捕获多样化多模态视觉粒度的能力。具体来说,Hiwin Transformer包含两个关键模块:(i)视觉细节注入模块,逐步将低级视觉细节注入高级语言对齐的语义特征,从而形成逆语义金字塔(ISP);(ii)分层窗口注意力模块,利用跨尺度窗口从ISP中浓缩多级语义。大量实验表明,LLaVA-UHD v2在广泛的基准测试中优于对比的MLLM。值得注意的是,与基线方法相比,我们的设计在14个基准测试上平均提升了3.7%,例如在DocVQA上提升了9.3%。所有数据和代码将公开,以促进未来的研究。

关键词

引用

@article{arxiv.2412.13871,
  title  = {LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer},
  author = {Yipeng Zhang and Yifan Liu and Zonghao Guo and Yidan Zhang and Xuesong Yang and Xiaoying Zhang and Chi Chen and Jun Song and Bo Zheng and Yuan Yao and Zhiyuan Liu and Tat-Seng Chua and Maosong Sun},
  journal= {arXiv preprint arXiv:2412.13871},
  year   = {2025}
}