中文

基于生成矩匹配网络的随机调制后滤波器用于基于 DNN 的歌声合成与神经双重录音

声音 2019-02-12 v1 人工智能 机器学习 多媒体 神经与进化计算 音频与语音处理

摘要

本文提出了一种基于生成矩匹配网络 (GMMN) 的后滤波器,为基于深度神经网络 (DNN) 的歌声合成提供话语间音高变化。人类歌声的自然音高变化带来了更丰富的音乐体验,并被用于双重录音,这是一种录音方法,将同一短语的两次表演录制并混合,以创造更丰富、分层的声音。然而,使用传统基于 DNN 的方法合成的歌声永远不会变化,因为合成过程是确定性的,一个乐谱仅合成一个波形。为了解决这个问题,我们使用 GMMN 对自然歌声音高轮廓的调制谱变化进行建模,并将随机的话语间变化添加到传统基于 DNN 的歌声合成生成的音高轮廓中。实验评估表明:1) 我们的方法能够在保持语音质量的同时提供可感知的话语间音高变化。我们将该方法扩展到双重录音,评估表明:2) 与传统基于信号处理的人工双重录音相比,基于 GMMN 的神经双重录音在感知上更接近自然双重录音。

关键词

引用

@article{arxiv.1902.03389,
  title  = {Generative Moment Matching Network-based Random Modulation Post-filter for DNN-based Singing Voice Synthesis and Neural Double-tracking},
  author = {Hiroki Tamaru and Yuki Saito and Shinnosuke Takamichi and Tomoki Koriyama and Hiroshi Saruwatari},
  journal= {arXiv preprint arXiv:1902.03389},
  year   = {2019}
}

备注

5 pages, to appear in IEEE ICASSP 2019 (Paper Code: SLP-P22.11, Session: Speech Synthesis III)