Muyan-TTS:面向 5 万美元预算优化的播客场景可训练语音合成模型
声音
2025-04-29 v1 音频与语音处理
摘要
近期语音合成(TTS)模型的进展得益于大型语言模型(LLM)的集成,增强了语义理解并提高了语音的自然性。然而,现有的 LLM 基于 TTS 模型常缺乏开源训练代码和高效推理加速框架,限制了其可访问性和可适应性。此外,目前没有针对播客场景的公开 TTS 模型,而播客场景在语音交互应用中需求极高。为解决这些限制,我们引入 Muyan-TTS,一个面向播客应用的开源可训练 TTS 模型,预算为 5 万美元。我们的模型在超过 10 万小时的播客音频数据上进行预训练,实现高质量语音生成的零样本 TTS 合成。此外,Muyan-TTS 支持针对目标语音进行数十分钟的说话人适应,使其对个体语音高度可定制。除了开源模型,我们提供了全面的数据收集和处理流程、完整的训练程序以及优化的推理框架,用于加速 LLM 基于 TTS 合成。我们的代码和模型可在 https://github.com/MYZY-AI/Muyan-TTS 获取。
引用
@article{arxiv.2504.19146,
title = {Muyan-TTS: A Trainable Text-to-Speech Model Optimized for Podcast Scenarios with a $50K Budget},
author = {Xin Li and Kaikai Jia and Hao Sun and Jun Dai and Ziyang Jiang},
journal= {arXiv preprint arXiv:2504.19146},
year = {2025}
}