Qwen3-VL 技术报告
计算机视觉与模式识别
2025-12-01 v2 人工智能
摘要
我们介绍 Qwen3-VL,这是截至目前为止 Qwen 系列中最具能力的视觉语言模型, 在广泛的多模态基准测试中实现卓越的性能。它原生支持最长达 256K token 的交错上下文,无缝集成文本、图像和视频。模型系列包括密集型(2B/4B/8B/32B)和稀疏专家(30B-A3B/235B-A22B)变体,以适应不同的延迟-质量权衡。Qwen3-VL 提供三个核心支柱:(i) 显著增强的纯文本理解,在多数情况下甚至超过相当于的文本-only 主干模型;(ii) 对长上下文理解的强大能力,原生支持文本和交错多模态输入的 256K token 窗口,使其能够忠实地保留、检索和跨引用长文档和视频中的信息;(iii) 跨单图像、多图像和视频任务的先进多模态推理, 在包括 MMMU 和视觉数学基准(如 MathVista 和 MathVision)的全面评估中表现领先。从结构上看,我们引入了三个关键升级:(i) 改进的交错-MRoPE 用于更强大的图像和视频的时空建模;(ii) DeepStack 集成,有效利用多级 ViT 特征以紧密对齐视觉语言;(iii) 视频的文本时间对齐,从 T-RoPE 演进为显式文本时间戳对齐,以实现更精确的时序定位。在相当相同的 token 预算和延迟约束下,Qwen3-VL 在密集和稀疏专家(MoE)架构中均实现卓越的性能。我们设想 Qwen3-VL 将作为面向图像 grounding 推理、代理式决策和多模态代码智能的基础引擎,服务于实际工作流程。
引用
@article{arxiv.2511.21631,
title = {Qwen3-VL Technical Report},
author = {Shuai Bai and Yuxuan Cai and Ruizhe Chen and Keqin Chen and Xionghui Chen and Zesen Cheng and Lianghao Deng and Wei Ding and Chang Gao and Chunjiang Ge and Wenbin Ge and Zhifang Guo and Qidong Huang and Jie Huang and Fei Huang and Binyuan Hui and Shutong Jiang and Zhaohai Li and Mingsheng Li and Mei Li and Kaixin Li and Zicheng Lin and Junyang Lin and Xuejing Liu and Jiawei Liu and Chenglong Liu and Yang Liu and Dayiheng Liu and Shixuan Liu and Dunjie Lu and Ruilin Luo and Chenxu Lv and Rui Men and Lingchen Meng and Xuancheng Ren and Xingzhang Ren and Sibo Song and Yuchong Sun and Jun Tang and Jianhong Tu and Jianqiang Wan and Peng Wang and Pengfei Wang and Qiuyue Wang and Yuxuan Wang and Tianbao Xie and Yiheng Xu and Haiyang Xu and Jin Xu and Zhibo Yang and Mingkun Yang and Jianxin Yang and An Yang and Bowen Yu and Fei Zhang and Hang Zhang and Xi Zhang and Bo Zheng and Humen Zhong and Jingren Zhou and Fan Zhou and Jing Zhou and Yuanzhi Zhu and Ke Zhu},
journal= {arXiv preprint arXiv:2511.21631},
year = {2025}
}
备注
42 pages