中文

Qwen3-TTS 技术报告

声音 2026-01-23 v1 计算与语言 音频与语音处理

摘要

在本报告中,我们介绍了 Qwen3-TTS 系列,这是一族先进的多语言、可控、鲁棒且支持流式的文本到语音模型。Qwen3-TTS 支持最先进的 3 秒声音克隆和基于描述的控制,既能创造全新的声音,也能对输出语音进行细粒度操控。Qwen3-TTS 在涵盖 10 种语言的超过 500 万小时语音数据上训练,采用双轨 LM 架构进行实时合成,并耦合了两个语音分词器:1) Qwen-TTS-Tokenizer-25Hz 是一个强调语义内容的单码本编解码器,它与 Qwen-Audio 无缝集成,并通过分块 DiT 实现流式波形重建。2) Qwen-TTS-Tokenizer-12Hz 实现了极致的比特率降低和超低延迟流式传输,通过其 12.5 Hz、16 层多码本设计和轻量级因果 ConvNet 实现了即时的首个数据包发出(97ms97\,\mathrm{ms})。大量实验表明,在多种客观和主观基准测试(例如 TTS 多语言测试集、InstructTTSEval 以及我们的长语音测试集)上均达到了最先进的性能。为了促进社区研究与开发,我们在 Apache 2.0 许可下发布了这两个分词器和模型。

关键词

引用

@article{arxiv.2601.15621,
  title  = {Qwen3-TTS Technical Report},
  author = {Hangrui Hu and Xinfa Zhu and Ting He and Dake Guo and Bin Zhang and Xiong Wang and Zhifang Guo and Ziyue Jiang and Hongkun Hao and Zishan Guo and Xinyu Zhang and Pei Zhang and Baosong Yang and Jin Xu and Jingren Zhou and Junyang Lin},
  journal= {arXiv preprint arXiv:2601.15621},
  year   = {2026}
}

备注

https://github.com/QwenLM/Qwen3-TTS