Qwen3 技术报告
计算与语言
2025-05-15 v1
摘要
在本工作中,我们发布了 Qwen3,即 Qwen 模型家族的最新版本。Qwen3 包含一系列旨在提升性能、效率与多语言能力的大语言模型 (LLM)。Qwen3 系列涵盖了稠密与混合专家 两种架构,参数规模从 0.6 到 2350 亿不等。Qwen3 的一项关键创新在于将思考模式(用于复杂的、多步推理)与非思考模式(用于快速的、上下文驱动的响应)整合至统一框架中。这消除了在不同模型(如针对对话优化的模型 GPT-4o 与专用推理模型 QwQ-32B)之间切换的需要,并允许基于用户查询或对话模板进行动态模式切换。同时,Qwen3 引入了思考预算机制,允许用户在推理过程中自适应地分配计算资源,从而基于任务复杂度平衡延迟与性能。此外,通过利用旗舰模型的知识,我们显著降低了构建较小规模模型所需的计算资源,同时确保其具备高度竞争力的性能。实证评估表明,Qwen3 在包括代码生成、数学推理、智能体任务等在内的多样化基准测试中取得了 SOTA 结果,足以与更大的 MoE 模型及专有模型相竞争。与其前身 Qwen2.5 相比,Qwen3 将多语言支持从 29 种语言和方言扩展至 119 种,通过改进跨语言理解与生成能力提升了全球可及性。为促进可复现性与社区驱动的研究与开发,所有 Qwen3 模型均在 Apache 2.0 许可下公开提供。
引用
@article{arxiv.2505.09388,
title = {Qwen3 Technical Report},
author = {An Yang and Anfeng Li and Baosong Yang and Beichen Zhang and Binyuan Hui and Bo Zheng and Bowen Yu and Chang Gao and Chengen Huang and Chenxu Lv and Chujie Zheng and Dayiheng Liu and Fan Zhou and Fei Huang and Feng Hu and Hao Ge and Haoran Wei and Huan Lin and Jialong Tang and Jian Yang and Jianhong Tu and Jianwei Zhang and Jianxin Yang and Jiaxi Yang and Jing Zhou and Jingren Zhou and Junyang Lin and Kai Dang and Keqin Bao and Kexin Yang and Le Yu and Lianghao Deng and Mei Li and Mingfeng Xue and Mingze Li and Pei Zhang and Peng Wang and Qin Zhu and Rui Men and Ruize Gao and Shixuan Liu and Shuang Luo and Tianhao Li and Tianyi Tang and Wenbiao Yin and Xingzhang Ren and Xinyu Wang and Xinyu Zhang and Xuancheng Ren and Yang Fan and Yang Su and Yichang Zhang and Yinger Zhang and Yu Wan and Yuqiong Liu and Zekun Wang and Zeyu Cui and Zhenru Zhang and Zhipeng Zhou and Zihan Qiu},
journal= {arXiv preprint arXiv:2505.09388},
year = {2025}
}