中文

HiFiSinger:面向高保真神经歌唱语音合成

音频与语音处理 2020-09-04 v1 计算与语言 机器学习 声音

摘要

高保真歌唱语音通常需要更高的采样率(例如48kHz)来传达表现力与情感。然而,更高的采样率在频域和时域上均导致更宽的频带和更长的波形序列,给歌唱语音合成(SVS)带来挑战。采用小采样率的常规SVS系统无法很好地应对上述挑战。本文中,我们开发了HiFiSinger,一个面向高保真歌唱语音的SVS系统。HiFiSinger由基于FastSpeech的声学模型和基于Parallel WaveGAN的声码器组成,以保证快速训练与推理以及高语音质量。为应对高采样率(更宽频带和更长波形)引起的歌唱建模困难,我们在声学模型和声码器中均引入多尺度对抗训练以改进歌唱建模。具体而言,1)为处理更高采样率导致的更大频率范围,我们提出一种新颖的子频带GAN(SF-GAN)用于梅尔谱生成,其将完整的80维梅尔频率拆分为多个子带,并用单独的判别器对各子带建模。2)为建模更高采样率导致的更长波形序列,我们提出多长度GAN(ML-GAN)用于波形生成,以用单独判别器建模不同长度的波形序列。3)我们还在HiFiSinger中引入了若干对高保真语音至关重要的额外设计与发现,例如将F0(音高)和V/UV(浊音/清音标志)作为声学特征、为梅尔谱选择适当的窗口/跳移大小,以及增大声码器中用于长元音建模的感知野。实验结果表明,HiFiSinger合成的高保真歌唱语音质量大幅提升:相较48kHz/24kHz基线分别有0.32/0.44 MOS增益,相较先前SVS系统有0.83 MOS增益。

关键词

引用

@article{arxiv.2009.01776,
  title  = {HiFiSinger: Towards High-Fidelity Neural Singing Voice Synthesis},
  author = {Jiawei Chen and Xu Tan and Jian Luan and Tao Qin and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:2009.01776},
  year   = {2020}
}