用于歌声神经声码器的分层扩散模型
声音
2022-10-19 v2 机器学习
音频与语音处理
摘要
深度生成模型的最新进展提升了语音领域神经声码器的质量。然而,由于音高、响度和发音方面更为多样的音乐表达,生成高质量歌声仍具挑战性。本工作中,我们提出了一种用于歌声神经声码器的分层扩散模型。所提方法由多个在不同采样率下运行的扩散模型组成;最低采样率的模型专注于生成准确的低频分量(如音高),其他模型基于较低采样率的数据和声学特征逐步在更高采样率下生成波形。实验结果表明,所提方法可为多位歌手生成高质量歌声,在以相近计算成本优于最先进(SOTA)神经声码器的同时展现出优越性能。
引用
@article{arxiv.2210.07508,
title = {Hierarchical Diffusion Models for Singing Voice Neural Vocoder},
author = {Naoya Takahashi and Mayank Kumar and Singh and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2210.07508},
year = {2022}
}