Qwen3-Omni 技术报告
摘要
我们介绍 Qwen3-Omni,这是一个单一的多模态模型,首次在文本、图像、音频和视频方面均保持与单模态版本相当的业界领先性能。Qwen3-Omni 在各项基准测试中与所需规模相同的单模态模型保持一致的表现,尤其在音频任务上表现突出。在 36 项音频和音视频基准测试中,Qwen3-Omni 在 32 项上实现开源最先进,在 22 项上实现整体最先进,超越了 Gemini-2.5-Pro、Seed-ASR 和 GPT-4o-Transcribe 等强大闭源模型。Qwen3-Omni 采用 Thinker-Talker 稀疏注意力机制架构,统一了文本、图像、音频和视频的感知与生成,实现流畅的文本和自然的实时语音。其支持文本交互的 119 种语言,语音理解的 19 种语言,以及语音生成的 10 种语言。为降低流式合成中的首包延迟,Talker 使用多码本方案自回归预测离散语音码率。凭借这些码率的表征能力,我们用轻量因果卷积网络取代计算密集的块状扩散,实现从首个码率帧的流式处理。在 cold-start 场景下,Qwen3-Omni 实现理论上的端到端首包延迟为 234\,ms。为进一步强化多模态推理,我们引入了思考模型,显式推理来自任意模态的输入。鉴于当前研究社区缺乏通用音频描述模型,我们对 Qwen3-Omni-30B-A3B 进行微调,以获得 Qwen3-Omni-30B-A3B-Captioner,可为任意音频输入生成详细且低幻觉的描述。Qwen3-Omni-30B-A3B、Qwen3-Omni-30B-A3B-Thinking 和 Qwen3-Omni-30B-A3B-Captioner 在 Apache 2.0 许可证下公开发布。
关键词
引用
@article{arxiv.2509.17765,
title = {Qwen3-Omni Technical Report},
author = {Jin Xu and Zhifang Guo and Hangrui Hu and Yunfei Chu and Xiong Wang and Jinzheng He and Yuxuan Wang and Xian Shi and Ting He and Xinfa Zhu and Yuanjun Lv and Yongqi Wang and Dake Guo and He Wang and Linhan Ma and Pei Zhang and Xinyu Zhang and Hongkun Hao and Zishan Guo and Baosong Yang and Bin Zhang and Ziyang Ma and Xipin Wei and Shuai Bai and Keqin Chen and Xuejing Liu and Peng Wang and Mingkun Yang and Dayiheng Liu and Xingzhang Ren and Bo Zheng and Rui Men and Fan Zhou and Bowen Yu and Jianxin Yang and Le Yu and Jingren Zhou and Junyang Lin},
journal= {arXiv preprint arXiv:2509.17765},
year = {2025}
}
备注
https://github.com/QwenLM/Qwen3-Omni