中文

用于语音合成的能量基模型

声音 2023-10-20 v1 机器学习 音频与语音处理

摘要

近来,人们对用于语音合成的非自回归(non-AR)模型,如 FastSpeech 2 与扩散模型,兴趣浓厚。与 AR 模型不同,这些模型在输出间无自回归依赖,从而使推理高效。本文以另一称为能量基模型(EBMs)的成员拓展了可用的非自回归模型范围。文中描述了依赖正样本与负样本比较的噪声对比估计如何用于训练 EBMs。提出了若干生成有效负样本的策略,包括使用高性能 AR 模型。还描述了如何使用朗之万马尔可夫链蒙特卡洛(MCMC)从 EBMs 采样。朗之万 MCMC 的使用使得 EBMs 与当前流行的扩散模型之间建立联系。在 LJSpeech 数据集上的实验表明,所提方法相较 Tacotron 2 有改进。

关键词

引用

@article{arxiv.2310.12765,
  title  = {Energy-Based Models For Speech Synthesis},
  author = {Wanli Sun and Zehai Tu and Anton Ragni},
  journal= {arXiv preprint arXiv:2310.12765},
  year   = {2023}
}