中文

贝叶斯语音合成器可从多个教师处学习

声音 2026-02-11 v3 音频与语音处理

摘要

语音合成(TTS)本质上是一种“一对多”的映射,具有内在不确定性,但当前的范式往往将其简化为确定性回归任务。虽然连续值自回归(AR)模型最近作为离散编解码器方法的有前景的替代方案,但它们通常依赖固定方差的先验,基本上将生成限制在静态点估计,忽略了自然语音的动态变动性。为弥合这一差距,我们提出BELLE(Bayesian evidential learning with language modelling),一个从确定性预测转向原则性贝叶斯推断的框架,无需增加模型参数或推断延迟。通过将声学目标建模为Normal-Inverse-Gamma分布,BELLE捕捉数据依赖的测量不确定性。为在标准单参考数据集上实现准确的方差估计,我们引入一种“一对多”训练策略,利用合成样本作为统计支持集,使模型能够学习稳健的分布属性,而不仅仅是模仿教师的伪影。实验表明,BELLE仅使用约5k小时的数据训练,便超过了在50k小时数据上训练的领先开源模型(实现25.8%的相对词错率降低),并自然支持高质量的流式生成。音频样本可在https://belletts.github.io/Belle/上获取。

关键词

引用

@article{arxiv.2510.24372,
  title  = {Bayesian Speech Synthesizers Can Learn from Multiple Teachers},
  author = {Ziyang Zhang and Yifan Gao and Xuenan Xu and Baoxiang Li and Wen Wu and Chao Zhang},
  journal= {arXiv preprint arXiv:2510.24372},
  year   = {2026}
}

备注

Code is available at https://github.com/OpenTSLab/BELLE