面向通用神经声码器的多频带激励WaveNet
音频与语音处理
2021-10-08 v1 声音
摘要
本文介绍了多频带激励WaveNet,一种用于语音与歌唱声音的神经声码器(neural vocoder)。其旨在推动最先进技术向通用神经声码器发展,即一种能够从语音信号提取的任意梅尔频谱生成语音信号的模型。继DDSP模型成功以及近期提出的激励声码器的发展,我们提出了一种由多个专用DNN与专用信号处理组件结合的声码器结构。所有组件均作为可微算子实现,因此允许模型参数的联合优化。为证明模型复现高质量语音信号的能力,我们在单说话人/歌手与多说话人/歌手数据集上评估该模型。我们进行了主观评价,表明这些模型支持广泛的域变化(未见过的声音、语言、表现力),达到了可与最先进通用神经声码器相媲美的感知质量,然而使用了显著更小的训练数据集与显著更少的参数。我们也展示了神经声码器通用性的剩余局限,例如饱和歌唱声音的创建。
引用
@article{arxiv.2110.03329,
title = {Towards Universal Neural Vocoding with a Multi-band Excited WaveNet},
author = {Axel Roebel and Frederik Bous},
journal= {arXiv preprint arXiv:2110.03329},
year = {2021}
}