中文

GIRAFFE:扩展视觉语言模型上下文长度的设计选择

计算机视觉与模式识别 2024-12-18 v1 人工智能 计算与语言

摘要

视觉语言模型在处理多模态输入方面展现出了令人瞩目的能力,然而诸如视觉智能体等需要处理多张图像和高分辨率视频的应用,则要求增强的长程建模能力。此外,现有的开源视觉语言模型缺乏对其上下文长度扩展的系统性探索,而商业模型通常只提供有限的细节。为了解决这一问题,我们旨在建立一种有效的解决方案,在保持短上下文场景能力的同时,增强视觉语言模型的长上下文性能。为实现这一目标,我们通过从数据筛选到上下文窗口扩展与利用的广泛实验设置做出了最佳设计选择:(1)我们分析了数据源和长度分布,以构建ETVLM——一种在各种场景间平衡性能的数据配方;(2)我们考察了现有的位置扩展方法,找出了它们的局限性,并提出了M-RoPE++作为一种增强方法;我们还选择仅使用混合源数据对主干网络进行指令微调;(3)我们讨论了如何更好地利用扩展的上下文窗口,并提出了混合分辨率训练。基于Qwen-VL系列模型,我们提出了Giraffe,它被有效地扩展至128K长度。在VideoMME和Visual Haystacks等广泛的长上下文视觉语言模型基准上进行了评估,我们的Giraffe在同等规模的开源长上下文视觉语言模型中实现了最先进的性能,并与商业模型GPT-4V具有竞争力。我们将开源代码、数据和模型。

关键词

引用

@article{arxiv.2412.12735,
  title  = {GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models},
  author = {Mukai Li and Lei Li and Shansan Gong and Qi Liu},
  journal= {arXiv preprint arXiv:2412.12735},
  year   = {2024}
}

备注

Working in progress