中文

桥接 LM-based TTS 模型中的训练与推理之间的鸿沟

声音 2025-09-23 v1 音频与语音处理

摘要

近期的文本转语音(TTS)进展表明,基于语言模型(LM)的系统在性能上与传统方法相竞争。然而,在训练过程中,TTS 模型使用真实(GT)标记作为前缀来预测下一个标记,而在推理过程中则不可用,这种训练-推理之间的差距往往被忽视。在本研究中,我们提出一种受提示引导的混合训练方案,以缓解 LM-based TTS 系统中的暴露偏差。我们的核心思想是采用混合训练范式,将 teacher forcing 与 free running 结合,从而在训练过程中引入自生成标记。这使得训练模式更符合推理,从而缩小训练-推理差距。此外,我们在训练期间采用 EOS 预测机制来检测错误的序列终止并自适应控制 free running 过程。实验结果对 LM-based TTS 中暴露偏差的影响进行了全面评估,并表明我们的方法有效缩小了训练-推理差距,从而提高了合成长篇语音的质量。

关键词

引用

@article{arxiv.2509.17021,
  title  = {Bridging the gap between training and inference in LM-based TTS models},
  author = {Ruonan Zhang and Lingzhou Mu and Xixin Wu and Kai Zhang},
  journal= {arXiv preprint arXiv:2509.17021},
  year   = {2025}
}

备注

5 pages, 4 figures