中文

VNet:用于语音合成声码器的基于 GAN 的多层判别器网络

音频与语音处理 2024-08-14 v1 人工智能

摘要

自生成对抗网络(GAN)引入语音合成以来,已取得了显著成就。在对声码器的全面探索中发现,通过利用基于 GAN 的模型,可以以超过实时的速度生成音频波形,同时保持高保真度。通常,声码器的输入为带限谱信息,这不可避免地牺牲了高频细节。为解决这一问题,我们采用全带 Mel 谱图信息作为输入,旨在为声码器提供尽可能全面的信息。然而,先前的研究表明,将全带谱信息用作输入可能导致过度平滑的问题,损害合成语音的自然度。为应对这一挑战,我们提出了 VNet,一个基于 GAN 的神经声码器网络,它融合了全带谱信息并引入了由多个子判别器组成的多层判别器(MTD)以生成高分辨率信号。此外,我们引入了一种渐近约束方法,修改生成器和判别器的对抗损失,增强训练过程的稳定性。通过严格的实验,我们证明了 VNet 模型能够生成高保真度语音,并显著提升声码器的性能。

关键词

引用

@article{arxiv.2408.06906,
  title  = {VNet: A GAN-based Multi-Tier Discriminator Network for Speech Synthesis Vocoders},
  author = {Yubing Cao and Yongming Li and Liejun Wang and Yinfeng Yu},
  journal= {arXiv preprint arXiv:2408.06906},
  year   = {2024}
}

备注

Accepted for publication by IEEE International Conference on Systems, Man, and Cybernetics 2024