中文

XiaoiceSing 2: 基于生成对抗网络的高保真歌声合成器

音频与语音处理 2022-10-31 v2 声音

摘要

XiaoiceSing 是一个旨在生成 48kHz 歌声的歌声合成 (SVS) 系统。然而,由于没有对中高频部分的细节进行专门设计,其生成的 mel 频谱图在中高频区域存在过度平滑现象。在本文中,我们提出了 XiaoiceSing2,它能够生成中高频部分的细节,以更好地构建全带 mel 频谱图。具体而言,为了缓解这一问题,XiaoiceSing2 采用了生成对抗网络 (GAN),该网络由基于 FastSpeech 的生成器和多频带判别器组成。我们通过在自注意力模块旁并行添加多个残差卷积块来改进前馈 Transformer (FFT) 块,以平衡局部和全局特征。多频带判别器包含三个子判别器,分别负责 mel 频谱图的低、中、高频部分。每个子判别器由若干段判别器 (SD) 和细节判别器 (DD) 组成,以从不同方面区分音频。在我们内部的 48kHz 歌声数据集上的实验表明,XiaoiceSing2 显著提高了相对于 XiaoiceSing 的歌声质量。

关键词

引用

@article{arxiv.2210.14666,
  title  = {Xiaoicesing 2: A High-Fidelity Singing Voice Synthesizer Based on Generative Adversarial Network},
  author = {Chunhui Wang and Chang Zeng and Xing He},
  journal= {arXiv preprint arXiv:2210.14666},
  year   = {2022}
}

备注

submitted to icassp2023