中文

用于基于 GAN 的非自回归 TTS 的多尺度时频谱图判别器

声音 2022-03-23 v2 音频与语音处理

摘要

生成对抗网络(GAN)通过使用一个额外的模型来区分真实语音和生成语音,对非自回归 TTS(NAR-TTS)进行对抗训练,已显示出其卓越的能力。为了最大化 GAN 的效益,找到一个能够捕捉丰富可区分信息的强大判别器至关重要。在本文中,我们提出了一种多尺度时频谱图判别器,以帮助 NAR-TTS 生成高保真度的梅尔谱图。它将谱图视为二维图像,以利用时频域中不同成分之间的相关性。并采用基于 U-Net 的模型结构在不同尺度上进行判别,以捕捉粗粒度和细粒度的信息。我们进行了主观测试来评估所提出的方法。多尺度和时频判别都在自然度和保真度方面带来了显著提升。当与神经声码器结合时,它显示出比微调声码器更有效和更简洁。最后,我们可视化了判别图以比较它们的差异,从而验证多尺度判别的有效性。

关键词

引用

@article{arxiv.2203.01080,
  title  = {A Multi-Scale Time-Frequency Spectrogram Discriminator for GAN-based Non-Autoregressive TTS},
  author = {Haohan Guo and Hui Lu and Xixin Wu and Helen Meng},
  journal= {arXiv preprint arXiv:2203.01080},
  year   = {2022}
}

备注

Submitted to INTERSPEECH 2022