中文

理解与表达:通过双语言建模实现文本转语音合成

声音 2025-09-29 v1 音频与语音处理

摘要

现有基于大语言模型(LLM)的自回归(AR)文本转语音(TTS)系统虽然实现了最先进的质量,但仍面临关键挑战。这一 LLM 范式的基础是通过神经音频编解码器将连续语音波形离散化为离散令牌序列。然而,单代码本建模适合文本 LLM,但存在显著的信息损失;通过残差向量量化(RVQ)生成的分层声学令牌通常缺乏明确的语义结构,给模型带来了沉重的学习负担。此外,自回归过程本质上容易受到误差累积的影响,可能降低生成的稳定性。为解决这些局限性,我们提出了 CaT-TTS,一个用于稳健且语义基础的零样本合成的新框架。首先,我们引入 S3Codec,一种分裂 RVQ 编解码器,通过来自最先进 ASR 模型的语义蒸馏将明确的语言特征注入其主代码本,提供简化学习任务的结构化表示。其次,我们提出「理解-然后-生成」的双 Transformer 架构,将理解与渲染解耦。初始的「理解」Transformer 建模文本与音频语义令牌之间的跨模态关系,形成高层话语计划。随后,「生成」Transformer 执行该计划,自回归地合成分层声学令牌。最后,为增强生成稳定性,我们引入掩码音频并行推理(MAPI),一种近乎无参数的推理策略,通过动态引导解码过程来缓解局部误差。

关键词

引用

@article{arxiv.2509.22062,
  title  = {Comprehend and Talk: Text to Speech Synthesis via Dual Language Modeling},
  author = {Junjie Cao and Yichen Han and Ruonan Zhang and Xiaoyang Hao and Hongxiang Li and Shuaijiang Zhao and Yue Liu and Xiao-Ping Zhng},
  journal= {arXiv preprint arXiv:2509.22062},
  year   = {2025}
}

备注

conference paper about TTS