HiFi-WaveGAN:带辅助谱图-相位损失用于高保真歌声生成的生成对抗网络
音频与语音处理
2023-09-19 v3 声音
摘要
面向娱乐的歌声合成 (SVS) 需要声码器生成高保真(如 48kHz)音频。然而,大多数文本转语音 (TTS) 声码器在此场景下无法良好重建波形。本文中,我们提出 HiFi-WaveGAN 以实时合成 48kHz 高质量歌声。具体而言,它由一个作为生成器的扩展 WaveNet、HiFiGAN 中提出多周期判别器,以及从 UnivNet 借用的多分辨率谱图判别器组成。为从全频带梅尔谱图更好地重建高频部分,我们引入脉冲提取器为合成波形生成约束。此外,利用辅助谱图-相位损失进一步逼近真实分布。实验结果表明,我们提出的 HiFi-WaveGAN 在 48kHz SVS 任务上取得 4.23 的平均意见分 (MOS),显著优于其他神经声码器。
引用
@article{arxiv.2210.12740,
title = {HiFi-WaveGAN: Generative Adversarial Network with Auxiliary Spectrogram-Phase Loss for High-Fidelity Singing Voice Generation},
author = {Chunhui Wang and Chang Zeng and Jun Chen and Xing He},
journal= {arXiv preprint arXiv:2210.12740},
year = {2023}
}