Qwen3-ASR技术报告
计算与语言
2026-02-02 v2 声音
音频与语音处理
摘要
本报告介绍了Qwen3-ASR系列模型,包括两个强大的全能语音识别模型和一个新型非自回归语音强制对齐模型。Qwen3-ASR-1.7B和Qwen3-ASR-0.6B是支持语言识别和52种语言和方言的语音识别模型。它们都利用大规模语音训练数据以及来自基础模型Qwen3-Omni的强大音频理解能力。我们除了开源基准测试外,还进行了全面的内部评估,因为语音识别模型在开源基准测试分数上可能几乎相同,但在实际场景中表现出显著的质量差异。实验结果表明,1.7B版本在开源语音识别模型中实现了SOTA性能,同时与最强的专有API保持竞争力;而0.6B版本在准确率与效率之间提供了最佳的权衡。Qwen3-ForcedAligner-0.6B是一个基于LLM的非自回归时间戳预测器,能够在11种语言中对文本-语音对进行对齐。时间戳准确性实验表明,所提出的模型在效率和通用性方面优于三个最强的强制对齐模型。为进一步加速社区对语音识别和音频理解的研究,我们将这些模型以Apache 2.0许可证发布。
引用
@article{arxiv.2601.21337,
title = {Qwen3-ASR Technical Report},
author = {Xian Shi and Xiong Wang and Zhifang Guo and Yongqi Wang and Pei Zhang and Xinyu Zhang and Zishan Guo and Hongkun Hao and Yu Xi and Baosong Yang and Jin Xu and Jingren Zhou and Junyang Lin},
journal= {arXiv preprint arXiv:2601.21337},
year = {2026}
}
备注
https://github.com/QwenLM/Qwen3-ASR