基于深度自回归神经网络的歌声合成声学建模
声音
2019-06-24 v1 机器学习
音频与语音处理
摘要
本文提出一种利用自回归神经网络进行歌声合成(SVS)声学建模的方法。歌声与语音不同,其声学特征包含更多局部动态变化,例如颤音。因此,我们的方法采用深度自回归(DAR)模型来预测歌声的基频(F0)与频谱特征,以更好地描述连续帧声学特征之间的依赖关系。在 F0 建模中,使用离散化 F0 值,并通过实验分析了 DAR 中历史长度的影响。还设计了一种 F0 后处理策略,以缓解预测的 F0 轮廓与由音符决定的 F0 值之间的不一致。此外,我们将 DAR 模型扩展用于处理连续频谱特征,并引入带有自注意力层的 prenet 模块来处理历史帧。在中文歌声语料上的实验表明,我们的 DAR 方法能有效生成带颤音的 F0 轮廓,并在客观与主观指标上优于使用循环神经网络(RNNs)的传统方法。
引用
@article{arxiv.1906.08977,
title = {Singing Voice Synthesis Using Deep Autoregressive Neural Networks for Acoustic Modeling},
author = {Yuan-Hao Yi and Yang Ai and Zhen-Hua Ling and Li-Rong Dai},
journal= {arXiv preprint arXiv:1906.08977},
year = {2019}
}
备注
Interspeech2019