用于基于 GAN 的非自回归 TTS 的多尺度时频谱图判别器
声音
2022-03-23 v2 音频与语音处理
摘要
生成对抗网络(GAN)通过使用一个额外的模型来区分真实语音和生成语音,对非自回归 TTS(NAR-TTS)进行对抗训练,已显示出其卓越的能力。为了最大化 GAN 的效益,找到一个能够捕捉丰富可区分信息的强大判别器至关重要。在本文中,我们提出了一种多尺度时频谱图判别器,以帮助 NAR-TTS 生成高保真度的梅尔谱图。它将谱图视为二维图像,以利用时频域中不同成分之间的相关性。并采用基于 U-Net 的模型结构在不同尺度上进行判别,以捕捉粗粒度和细粒度的信息。我们进行了主观测试来评估所提出的方法。多尺度和时频判别都在自然度和保真度方面带来了显著提升。当与神经声码器结合时,它显示出比微调声码器更有效和更简洁。最后,我们可视化了判别图以比较它们的差异,从而验证多尺度判别的有效性。
引用
@article{arxiv.2203.01080,
title = {A Multi-Scale Time-Frequency Spectrogram Discriminator for GAN-based Non-Autoregressive TTS},
author = {Haohan Guo and Hui Lu and Xixin Wu and Helen Meng},
journal= {arXiv preprint arXiv:2203.01080},
year = {2022}
}
备注
Submitted to INTERSPEECH 2022