GOAT-TTS:基于双分支 LLM 的表现力丰富且逼真的语音生成
计算与语言
2025-05-29 v2 声音
音频与语音处理
摘要
尽管大型语言模型 (LLM) 通过离散化范式彻底改变了文本到语音 (TTS) 合成,但当前架构在三个关键维度上表现出根本性的矛盾:1) 语音提示的量化导致声学特征的不可逆丢失;2) 严重依赖精确对齐的提示语音-文本对,限制了现实世界中的部署;3) 在针对语音 token 生成的优化过程中,LLM 原生文本理解能力发生灾难性遗忘。为了应对这些挑战,我们提出了一种基于 LLM 的文本到语音生成方法,并通过新颖的双分支架构进行优化 (GOAT-TTS)。我们的框架引入了两项关键创新:(1) 模态对齐分支结合了语音编码器和投影器,以捕获连续的声学嵌入,从而在不依赖转录文本的情况下实现副语言特征(语言、音色、情感)与语义文本表示之间的双向关联;(2) 语音生成分支在 LLM 的 top-k 层上采用模块化微调进行语音 token 预测,同时冻结底部的 n 层以保留基础语言知识。此外,引入了多 token 预测以支持实时流式 TTS 合成。实验结果表明,我们的 GOAT-TTS 取得了与 SOTA TTS 模型相当的性能,同时验证了合成方言语音数据的有效性。
引用
@article{arxiv.2504.12339,
title = {GOAT-TTS: Expressive and Realistic Speech Generation via A Dual-Branch LLM},
author = {Yaodong Song and Hongjie Chen and Jie Lian and Yuxin Zhang and Guangmin Xia and Zehan Li and Genliang Zhao and Jian Kang and Jie Li and Yongxiang Li and Xuelong Li},
journal= {arXiv preprint arXiv:2504.12339},
year = {2025}
}