FireRedTTS-2:面向播客与聊天机器人长对话语音生成
声音
2025-09-05 v2 音频与语音处理
摘要
当前的对话生成方法通常需要在合成之前获取完整的对话文本,并且生成单一的、不可分割的语音,包含所有说话人,这使得它们不适用于交互式聊天;此外,这些方法还存在语音合成不稳定、说话人转换不准确以及语义不连贯等问题。本文提出了 FireRedTTS-2,一种用于多说话人对话生成的长篇流式 TTS 系统,能够提供稳定、自然的语音,实现可靠的说话人切换和情境感知的语音韵律。我们引入一种新的 12.5Hz 流式语音词典,加速训练和推理,扩展对话长度的最大值,对文本到词典建模编码更丰富的语义,以支持实时应用的高保真流式生成。我们采用文本-语音交错格式,将带有说话人标签的文本与对齐语音词典按时间顺序拼接,并使用双 Transformer 建模:大型解码器专注于预测第一层词典,较小的 Transformer 完成后续层的预测。实验结果表明,FireRedTTS-2 可无缝集成到聊天框架中,通过最小程度的微调,生成由潜在情境线索引导的情感表达语音。在播客生成方面,它在客观可理解性、说话人轮次可靠性以及情境一致的语音韵律感知自然性方面超越了包括 MoonCast、Zipvoice-Dialogue 和 MOSS-TTSD 在内的现有系统。我们的演示已公开:https://fireredteam.github.io/demos/firered_tts_2。
引用
@article{arxiv.2509.02020,
title = {FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot},
author = {Kun Xie and Feiyu Shen and Junjie Li and Fenglong Xie and Xu Tang and Yao Hu},
journal= {arXiv preprint arXiv:2509.02020},
year = {2025}
}