中文

基于双判别器对抗训练的去噪扩散模型用于高保真多说话人语音合成

声音 2024-04-30 v1 机器学习 音频与语音处理

摘要

扩散模型能够通过概率方法生成高质量数据。然而,由于需要大量时间步,其存在生成速度慢的缺点。为克服该局限,近期模型如去噪扩散隐式模型(DDIM)侧重于不直接建模概率分布来生成样本,而如去噪扩散生成对抗网络(GAN)等模型将扩散过程与 GAN 结合。在语音合成领域,近期提出的利用 GAN 结构的扩散语音合成模型 DiffGAN-TTS 展现出在语音质量与生成速度上的优越性能。本文为进一步增强 DiffGAN-TTS 性能,提出一种带有两个判别器的语音合成模型:一个扩散判别器用于学习反向过程的分布,一个谱图判别器用于学习生成数据的分布。采用结构相似性指数测度(SSIM)、梅尔倒谱失真(MCD)、F0 均方根误差(F0 RMSE)、短时客观可懂度(STOI)、语音质量感知评估(PESQ)等客观指标,以及平均意见得分(MOS)等主观指标评估所提模型性能。评估结果显示,所提模型在多项指标上优于 FastSpeech2、DiffGAN-TTS 等近期最优模型。我们的实现与音频样本发布于 GitHub。

关键词

引用

@article{arxiv.2308.01573,
  title  = {Adversarial Training of Denoising Diffusion Model Using Dual Discriminators for High-Fidelity Multi-Speaker TTS},
  author = {Myeongjin Ko and Yong-Hoon Choi},
  journal= {arXiv preprint arXiv:2308.01573},
  year   = {2024}
}