中文

面向通用神经声码器的多频带激励WaveNet

音频与语音处理 2021-10-08 v1 声音

摘要

本文介绍了多频带激励WaveNet,一种用于语音与歌唱声音的神经声码器(neural vocoder)。其旨在推动最先进技术向通用神经声码器发展,即一种能够从语音信号提取的任意梅尔频谱生成语音信号的模型。继DDSP模型成功以及近期提出的激励声码器的发展,我们提出了一种由多个专用DNN与专用信号处理组件结合的声码器结构。所有组件均作为可微算子实现,因此允许模型参数的联合优化。为证明模型复现高质量语音信号的能力,我们在单说话人/歌手与多说话人/歌手数据集上评估该模型。我们进行了主观评价,表明这些模型支持广泛的域变化(未见过的声音、语言、表现力),达到了可与最先进通用神经声码器相媲美的感知质量,然而使用了显著更小的训练数据集与显著更少的参数。我们也展示了神经声码器通用性的剩余局限,例如饱和歌唱声音的创建。

关键词

引用

@article{arxiv.2110.03329,
  title  = {Towards Universal Neural Vocoding with a Multi-band Excited WaveNet},
  author = {Axel Roebel and Frederik Bous},
  journal= {arXiv preprint arXiv:2110.03329},
  year   = {2021}
}