中文

基于Transducer与自回归建模的零样本流式文本转语音合成

机器学习 2025-06-03 v2

摘要

零样本流式文本转语音是人机交互中的一个重要研究课题。现有方法主要使用前瞻机制,依赖未来文本来实现自然的流式语音合成,这引入了较高的处理延迟。为了解决这个问题,我们提出了SMLLE,一个逐帧生成高质量语音的流式框架。SMLLE采用Transducer实时将文本转换为语义token,同时获取时长对齐信息。组合输出随后被送入一个完全自回归(AR)流式模型以重建mel-spectrograms。为了进一步稳定生成过程,我们设计了一种Delete < Bos > Mechanism,允许AR模型在引入尽可能小延迟的情况下访问未来文本。实验结果表明,SMLLE优于当前的流式TTS方法,并且在与句子级TTS系统的对比中取得了可比的性能。样本可在 shy-98.github.io/SMLLE_demo_page/ 获取。

关键词

引用

@article{arxiv.2505.19669,
  title  = {Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling},
  author = {Haiyang Sun and Shujie Hu and Shujie Liu and Lingwei Meng and Hui Wang and Bing Han and Yifan Yang and Yanqing Liu and Sheng Zhao and Yan Lu and Yanmin Qian},
  journal= {arXiv preprint arXiv:2505.19669},
  year   = {2025}
}