中文

Feast Your Eyes:多模态大语言模型的分辨率混合自适应

计算机视觉与模式识别 2024-03-06 v1

摘要

尽管取得了显著进展,现有的多模态大语言模型(MLLMs)在细粒度视觉识别方面仍然逊色。与以往的工作相反,我们从图像分辨率的角度研究这一问题,并揭示低分辨率和高分辨率视觉特征的组合可以有效缓解这一缺陷。基于这一观察,我们提出了一种针对 MLLMs 的新颖高效方法,称为分辨率混合自适应(Mixture-of-Resolution Adaptation, MRA)。具体而言,MRA 针对不同分辨率的图像采用两条视觉通路,其中高分辨率视觉信息通过新颖的分辨率混合适配器(MR-Adapters)嵌入到低分辨率通路中。这种设计也大大减少了 MLLMs 的输入序列长度。为了验证 MRA,我们将其应用于最近的 MLLM LLaVA,并将新模型命名为 LLaVA-HR。我们在 11 个视觉 - 语言(VL)任务上进行了大量实验,结果表明 LLaVA-HR 在 8 个 VL 任务上优于现有的 MLLMs,例如在 TextVQA 上提升了 +9.4%。更重要的是,借助 MRA,LLaVA-HR 的训练和推理均保持高效,例如训练时间为 20 小时,推理速度是 LLaVA-1.5 的 3 倍。源代码已发布:https://github.com/luogen1996/LLaVA-HR。

关键词

引用

@article{arxiv.2403.03003,
  title  = {Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models},
  author = {Gen Luo and Yiyi Zhou and Yuxin Zhang and Xiawu Zheng and Xiaoshuai Sun and Rongrong Ji},
  journal= {arXiv preprint arXiv:2403.03003},
  year   = {2024}
}