UniTTS:无需解耦声学与语义信息的端到端TTS系统
声音
2025-05-26 v1 人工智能
音频与语音处理
摘要
多码本中性音频编解码器,如残差向量量化(RVQ)和群向量量化(GVQ)的出现显著推动了基于大语言模型(LLM)的文本到语音(TTS)系统发展。这些编解码器在分离语义与声学信息的同时,能够高效地利用语义先验。然而,由于语义与声学信息无法完全对齐,这些方法在应用于 LLM 基础的 TTS 时,一个显著缺点是大语言模型可能无法充分获取完整的音频信息。为此,我们提出了 DistilCodec 和 UniTTS,两者 collectively 提供了以下优势:1) 该方法可将多码本音频编解码器蒸馏为单码本音频编解码器,拥有 32,768 个代码,且实现近 100% 的利用率。2) 由于 DistilCodec 不采用语义对齐方案,因此可以在训练时纳入大量高质量无标签音频(如有声书、歌曲等),进一步扩充数据多样性,拓宽适用范围。3) 利用 DistilCodec 对完整音频信息的建模,我们将三个关键任务整合到 UniTTS 的预训练框架中:音频模态自回归、文本模态自回归以及语音-文本跨模态自回归。这使 UniTTS 能够接受交错的文本和语音/音频提示,同时大幅保持 LLM 的文本能力。4) UniTTS 采用三阶段训练流程:预训练、监督微调(SFT)和对齐。源代码和模型检查点已公开于 https://github.com/IDEA-Emdoor-Lab/UniTTS 和 https://github.com/IDEA-Emdoor-Lab/DistilCodec。
引用
@article{arxiv.2505.17426,
title = {UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information},
author = {Rui Wang and Qianguo Sun and Tianrong Chen and Zhiyun Zeng and Junlong Wu and Jiaxing Zhang},
journal= {arXiv preprint arXiv:2505.17426},
year = {2025}
}