中文

TouchTTS:每个人都能触及的极简 TTS 框架

声音 2024-12-13 v2 计算与语言 音频与语音处理

摘要

众所周知,基于 LLM 的系统数据需求量大。近期的 LLM-based TTS 作品通常采用复杂的数据处理管线以获得高质量训练数据。这些精细化管线需要每个阶段(如语音去噪、语音增强、说话人分割和标点模型)都具备优秀模型,而这些模型本身也需要高质量训练数据且很少开源。即便使用最先进的模型,问题仍然存在,如背景噪声移除不完全以及标点与实际语音停顿之间的错位。此外,严格的过滤策略往往仅保留原始数据的 10-30\%,显著阻碍数据规模化 efforts。本文我们利用噪声鲁棒的音频标记化器(S3Tokenizer)设计了一个简化而有效的 TTS 数据处理管线,在保持数据质量的同时大幅降低数据获取成本,实现数据保留率超过 50\%。除了数据规模化的挑战,LLM-based TTS 系统还比传统方法的部署成本更高。当前系统通常仅将 LLM 用于文本到标记的生成,而需要单独的模型(如流匹配模型)进行标记到波形的生成,这些模型无法直接由 LLM 推理引擎执行,进一步复杂化了部署。为此,我们消除了 LLM 和流组件中的冗余模块,替换流模型背板为 LLM 架构。基于此简化的流背板,我们提出了一种用于流式和非流式推理的统一架构,显著降低了部署成本。最后,我们探讨了利用简化的管线和 S3Tokenizer 降低 TTS 训练数据质量要求,使 TTS 和 ASR 任务使用相同数据训练的可行性。

关键词

引用

@article{arxiv.2412.08237,
  title  = {TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch},
  author = {Xingchen Song and Mengtao Xing and Changwei Ma and Shengqiang Li and Di Wu and Binbin Zhang and Fuping Pan and Dinghao Zhou and Yuekai Zhang and Shun Lei and Zhendong Peng and Zhiyong Wu},
  journal= {arXiv preprint arXiv:2412.08237},
  year   = {2024}
}

备注

Technical Report