桥接 LM-based TTS 模型中的训练与推理之间的鸿沟
声音
2025-09-23 v1 音频与语音处理
摘要
近期的文本转语音(TTS)进展表明,基于语言模型(LM)的系统在性能上与传统方法相竞争。然而,在训练过程中,TTS 模型使用真实(GT)标记作为前缀来预测下一个标记,而在推理过程中则不可用,这种训练-推理之间的差距往往被忽视。在本研究中,我们提出一种受提示引导的混合训练方案,以缓解 LM-based TTS 系统中的暴露偏差。我们的核心思想是采用混合训练范式,将 teacher forcing 与 free running 结合,从而在训练过程中引入自生成标记。这使得训练模式更符合推理,从而缩小训练-推理差距。此外,我们在训练期间采用 EOS 预测机制来检测错误的序列终止并自适应控制 free running 过程。实验结果对 LM-based TTS 中暴露偏差的影响进行了全面评估,并表明我们的方法有效缩小了训练-推理差距,从而提高了合成长篇语音的质量。
引用
@article{arxiv.2509.17021,
title = {Bridging the gap between training and inference in LM-based TTS models},
author = {Ruonan Zhang and Lingzhou Mu and Xixin Wu and Kai Zhang},
journal= {arXiv preprint arXiv:2509.17021},
year = {2025}
}
备注
5 pages, 4 figures