中文

GLM-TTS 技术报告

声音 2025-12-17 v1

摘要

本工作提出 GLM-TTS,一款面向效率、可控性和高保真语音生成的生产级 TTS 系统。GLM-TTS 遵循两阶段架构,包括文本到标记的自回归模型和标记到波形的扩散模型。仅需 10 万小时训练数据,GLM-TTS 便在多个开源基准上实现了业界领先水平。为满足生产需求,GLM-TTS 通过优化带有基频约束的语音标记化器,以及基于 GRPO 的多奖励强化学习框架来提升语音质量,该框架联合优化发音、说话人相似度和情感抒情。同时,系统通过参数高效的 LoRA 语音定制和混合音素-文本输入方案实现高效可控的部署,后者提供精确的发音控制。我们的代码已公开于 https://github.com/zai-org/GLM-TTS。实时语音合成演示通过 Z.ai(audio.z.ai)以及智谱清言应用/网页(chatglm.cn)提供。

关键词

引用

@article{arxiv.2512.14291,
  title  = {GLM-TTS Technical Report},
  author = {Jiayan Cui and Zhihan Yang and Naihan Li and Jiankun Tian and Xingyu Ma and Yi Zhang and Guangyu Chen and Runxuan Yang and Yuqing Cheng and Yizhi Zhou and Guochen Yu and Xiaotao Gu and Jie Tang},
  journal= {arXiv preprint arXiv:2512.14291},
  year   = {2025}
}