中文

Qwen2.5-VL 技术报告

计算机视觉与模式识别 2025-03-05 v1 计算与语言

摘要

我们介绍了 Qwen2.5-VL,这是 Qwen 视觉语言系列的最新旗舰模型,它在基础能力和创新功能上均展现出显著进步。通过增强的视觉识别、精确的目标定位、鲁棒的文档解析和长视频理解,Qwen2.5-VL 在理解世界并与世界交互方面实现了重大飞跃。Qwen2.5-VL 的一个突出特点是能够使用边界框或点准确地对目标进行定位。它提供了从发票、表单和表格中提取结构化数据的鲁棒能力,以及对图表、图示和布局的详细分析。为了处理复杂输入,Qwen2.5-VL 引入了动态分辨率处理和绝对时间编码,使其能够处理不同尺寸的图像和超长(长达数小时)的视频,并实现秒级的事件定位。这使得模型能够原生感知空间尺度和时间动态,而无需依赖传统的归一化技术。通过从头开始训练原生动态分辨率 Vision Transformer (ViT) 并结合 Window Attention,我们在保持原生分辨率的同时减少了计算开销。因此,Qwen2.5-VL 不仅在静态图像和文档理解方面表现出色,还能作为交互式视觉智能体,在操作计算机和移动设备等真实场景中执行推理、工具使用和任务执行。Qwen2.5-VL 提供三种尺寸,以满足从边缘 AI 到高性能计算的多样化用例需求。旗舰模型 Qwen2.5-VL-72B 与 GPT-4o 和 Claude 3.5 Sonnet 等最先进的模型相媲美,特别是在文档和图表理解方面表现优异。此外,Qwen2.5-VL 保持了鲁棒的语言性能,保留了 Qwen2.5 LLM 的核心语言能力。

关键词

引用

@article{arxiv.2502.13923,
  title  = {Qwen2.5-VL Technical Report},
  author = {Shuai Bai and Keqin Chen and Xuejing Liu and Jialin Wang and Wenbin Ge and Sibo Song and Kai Dang and Peng Wang and Shijie Wang and Jun Tang and Humen Zhong and Yuanzhi Zhu and Mingkun Yang and Zhaohai Li and Jianqiang Wan and Pengfei Wang and Wei Ding and Zheren Fu and Yiheng Xu and Jiabo Ye and Xi Zhang and Tianbao Xie and Zesen Cheng and Hang Zhang and Zhibo Yang and Haiyang Xu and Junyang Lin},
  journal= {arXiv preprint arXiv:2502.13923},
  year   = {2025}
}