中文

RWKVTTS:基于 RWKV-7 的语音合成系统

声音 2025-04-07 v1 计算与语言 音频与语音处理

摘要

人机交互依赖于直观且高效的界面,其中语音作为尤为自然且易于访问的模态。近期基于Transformer的文本语音合成(TTS)系统,如 Fish-Speech、CosyVoice 和 MegaTTS 3,已在质量和真实性方面取得显著进展,推动了TTS领域的重大演进。本文引入了 RWKV-7 \cite{peng2025rwkv},一种为TTS应用量身定制的前沿RNN架构。不同于传统Transformer模型,RWKV-7 利用循环神经网络的优势,在保持高质量输出的同时,实现更大的计算效率和可扩展性。我们的全面基准测试表明,RWKV-7 在合成速度、语音自然性和资源效率等多个关键指标上均优于基于Transformer的模型。此外,我们探索了其对多样语言环境和低资源环境的适应性,展示了其为TTS技术民主化所需的潜力。这些发现将RWKV-7 定位为一种强大且创新性的替代方案,为现实应用中更易于访问和多功能的语音合成解决方案铺平了道路。我们的代码和模型权重可在 https://github.com/yynil/RWKVTTS、https://huggingface.co/spaces/RWKV-Red-Team 获取。

关键词

引用

@article{arxiv.2504.03289,
  title  = {RWKVTTS: Yet another TTS based on RWKV-7},
  author = {Lin yueyu and Liu Xiao},
  journal= {arXiv preprint arXiv:2504.03289},
  year   = {2025}
}