FNH-TTS:基于混合专家的语音合成持续时间建模
音频与语音处理
2026-05-29 v3
摘要
当前的非自回归(NAR)文本语音合成(TTS)系统仍在建模多样化和说话者依赖的持续时间变化方面存在挑战。我们进一步观察到,更丰富的持续时间变化会增加现有基于HiFi-GAN的声码器的合成难度,导致谱系伪影和不稳定的时间频率结构。为此,我们提出FNH-TTS,一个基于VITS的端到端TTS系统,采用混合专家持续时间建模和稳健的声码器侧合成。具体而言,我们引入混合专家持续时间预测器(MoE-DP)来捕获多样化的音节持续时间模式和说话者依赖的说话速率特征。为将更丰富的持续时间变化转化为稳定的波形生成,我们进一步集成了具有协作多带和子带判别器的VOCOS式声码器。在LJSpeech、VCTK和LibriTTS数据集上的实验表明,FNH-TTS在合成质量、持续时间类别准确率、声码器重构质量和推理效率方面均取得了改进。进一步分析表明,MoE-DP是持续时间建模改进的主要来源,而更强大的声码器侧组件对于在更丰富的持续时间变化下实现稳健合成是必要的。
引用
@article{arxiv.2508.12001,
title = {FNH-TTS: Mixture-of-Experts Duration Modeling for Robust Neural Speech Synthesis},
author = {Qingliang Meng and Yuqing Deng and Wei Liang and Limei Yu and Huizhi Liang and Tian Li},
journal= {arXiv preprint arXiv:2508.12001},
year = {2026}
}