JoyTTS:基于大语言模型的带语音克隆功能的口语化聊天机器人
声音
2025-07-04 v1 计算与语言
音频与语音处理
摘要
JoyTTS 是一个集大语言模型(LLM)与文本转语音(TTS)技术于一体、具备语音克隆功能的端到端口语化聊天机器人。该项目基于开源的 MiniCPM-o 和 CosyVoice2 模型构建,训练数据为 2000 小时的对话数据。我们还提供了完整的训练代码,以便社区进一步开发和优化。在测试机器 seed-tts-zh 上,该模型实现了 0.73 的说话人相似度(SS)得分和 5.09 的词错误率(WER)。代码、模型及训练和推理脚本均已发布于 https://github.com/jdh-algo/JoyTTS.git。
引用
@article{arxiv.2507.02380,
title = {JoyTTS: LLM-based Spoken Chatbot With Voice Cloning},
author = {Fangru Zhou and Jun Zhao and Guoxin Wang},
journal= {arXiv preprint arXiv:2507.02380},
year = {2025}
}