中文

NU-Wave:一种用于神经音频上采样的扩散概率模型

音频与语音处理 2022-11-10 v2 人工智能 机器学习

摘要

在本工作中,我们介绍 NU-Wave,首个从粗粒度的 16kHz 或 24kHz 输入生成采样率为 48kHz 波形的神经音频上采样模型,而先前工作至多只能生成 16kHz。NU-Wave 是基于神经声码器构建的首个用于音频超分辨率的扩散概率模型。NU-Wave 生成的高质量音频在信噪比(SNR)、对数谱距离(LSD)和 ABX 测试准确率方面均取得高性能。在所有情况下,尽管 NU-Wave 的模型容量(3.0M 参数)远小于基线模型(5.4–21%),其表现仍优于基线模型。我们模型的音频样本可在 https://mindslab-ai.github.io/nuwave 获取,代码将很快公开。

关键词

引用

@article{arxiv.2104.02321,
  title  = {NU-Wave: A Diffusion Probabilistic Model for Neural Audio Upsampling},
  author = {Junhyeok Lee and Seungu Han},
  journal= {arXiv preprint arXiv:2104.02321},
  year   = {2022}
}

备注

Accepted to Interspeech 2021