中文

Qwen2-VL:提升任意分辨率下视觉语言模型的感知能力

计算机视觉与模式识别 2024-10-04 v2 人工智能 计算与语言

摘要

我们提出 Qwen2-VL 系列,这是前一代 Qwen-VL 模型的重要升级,重新定义了视觉处理中传统的固定分辨率方法。Qwen2-VL 引入 Naive 动态分辨率机制,使模型能够动态处理不同分辨率的图像生成不同的视觉标记数量。这一方法使模型能够生成更高效、更准确的视觉表征,更贴近人类感知过程。该模型还集成了多模态旋转位置编码 (M-RoPE),促进文本、图像和视频中位置信息的有效融合。我们采用统一的范式处理图像和视频,提升了模型的视觉感知能力。为探索大型多模态模型的潜力,Qwen2-VL 研究了大型视觉语言模型 (LVLMs) 的规模定律。通过不断扩大模型规模——提供 2B、8B 和 72B 参数版本——以及训练数据的量,Qwen2-VL 系列实现了高度具竞争力的性能。值得注意的是,Qwen2-VL-72B 模型在各种多模态基准测试中达到了与 GPT-4o 和 Claude3.5-Sonnet 相当的成绩,超越了其他通用模型。代码可在 https://github.com/QwenLM/Qwen2-VL 查看。

关键词

引用

@article{arxiv.2409.12191,
  title  = {Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution},
  author = {Peng Wang and Shuai Bai and Sinan Tan and Shijie Wang and Zhihao Fan and Jinze Bai and Keqin Chen and Xuejing Liu and Jialin Wang and Wenbin Ge and Yang Fan and Kai Dang and Mengfei Du and Xuancheng Ren and Rui Men and Dayiheng Liu and Chang Zhou and Jingren Zhou and Junyang Lin},
  journal= {arXiv preprint arXiv:2409.12191},
  year   = {2024}
}

备注

Code is available at https://github.com/QwenLM/Qwen2-VL. arXiv admin note: text overlap with arXiv:2408.15262 by other authors