中文

InternLM-XComposer2-4KHD:支持 336 像素至 4K 高清分辨率的开创性大型视觉语言模型

计算机视觉与模式识别 2024-04-10 v1 计算与语言

摘要

大型视觉语言模型领域取得了显著进展,但由于分辨率有限,其对细粒度视觉内容的理解进展受到阻碍。近期的努力旨在增强 LVLMs 的高分辨率理解能力,但它们仍被限制在约 1500 x 1500 像素,并局限于相对狭窄的分辨率范围。本文介绍了 InternLM-XComposer2-4KHD,这是一项将 LVLM 分辨率能力提升至 4K HD (3840 x 1600) 及以上的开创性探索。同时,考虑到超高清分辨率并非在所有场景中都是必需的,它支持从 336 像素到 4K 标准的广泛多样化分辨率,显著拓宽了其适用范围。具体而言,本研究通过引入一项新颖的扩展来推进图像块划分范式:具有自动图像块配置的动态分辨率。它保持训练图像的纵横比,同时基于预训练的 Vision Transformer (ViT) (336 x 336) 自动改变图像块数量并配置布局,从而实现从 336 像素到 4K 标准的动态训练分辨率。我们的研究表明,将训练分辨率扩展至 4K HD 会带来持续的性能提升,且未触及潜在改进的上限。InternLM-XComposer2-4KHD 展示了卓越的能力,在 16 个基准中的 10 个上匹配甚至超越了 GPT-4V 和 Gemini Pro。具有 7B 参数的 InternLM-XComposer2-4KHD 模型系列已在 https://github.com/InternLM/InternLM-XComposer 公开提供。

关键词

引用

@article{arxiv.2404.06512,
  title  = {InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD},
  author = {Xiaoyi Dong and Pan Zhang and Yuhang Zang and Yuhang Cao and Bin Wang and Linke Ouyang and Songyang Zhang and Haodong Duan and Wenwei Zhang and Yining Li and Hang Yan and Yang Gao and Zhe Chen and Xinyue Zhang and Wei Li and Jingwen Li and Wenhai Wang and Kai Chen and Conghui He and Xingcheng Zhang and Jifeng Dai and Yu Qiao and Dahua Lin and Jiaqi Wang},
  journal= {arXiv preprint arXiv:2404.06512},
  year   = {2024}
}

备注

Code and models are publicly available at https://github.com/InternLM/InternLM-XComposer