XiaoiceSing 2: 基于生成对抗网络的高保真歌声合成器
音频与语音处理
2022-10-31 v2 声音
摘要
XiaoiceSing 是一个旨在生成 48kHz 歌声的歌声合成 (SVS) 系统。然而,由于没有对中高频部分的细节进行专门设计,其生成的 mel 频谱图在中高频区域存在过度平滑现象。在本文中,我们提出了 XiaoiceSing2,它能够生成中高频部分的细节,以更好地构建全带 mel 频谱图。具体而言,为了缓解这一问题,XiaoiceSing2 采用了生成对抗网络 (GAN),该网络由基于 FastSpeech 的生成器和多频带判别器组成。我们通过在自注意力模块旁并行添加多个残差卷积块来改进前馈 Transformer (FFT) 块,以平衡局部和全局特征。多频带判别器包含三个子判别器,分别负责 mel 频谱图的低、中、高频部分。每个子判别器由若干段判别器 (SD) 和细节判别器 (DD) 组成,以从不同方面区分音频。在我们内部的 48kHz 歌声数据集上的实验表明,XiaoiceSing2 显著提高了相对于 XiaoiceSing 的歌声质量。
引用
@article{arxiv.2210.14666,
title = {Xiaoicesing 2: A High-Fidelity Singing Voice Synthesizer Based on Generative Adversarial Network},
author = {Chunhui Wang and Chang Zeng and Xing He},
journal= {arXiv preprint arXiv:2210.14666},
year = {2022}
}
备注
submitted to icassp2023