中文

NU-Wave 2:一种适用于多种采样率的通用神经音频上采样模型

音频与语音处理 2022-09-28 v2 机器学习

摘要

传统上,音频超分辨率模型固定初始和目标采样率,这使得每种采样率组合都需要重新训练模型。我们提出 NU-Wave 2,一种用于神经音频上采样的扩散模型,可通过单一模型从各种采样率的输入生成 48 kHz 音频信号。基于 NU-Wave 的架构,NU-Wave 2 使用短时傅里叶卷积(STFC)生成谐波以解决 NU-Wave 的主要失效模式,并引入带宽谱特征变换(BSFT)在频域中对输入的带宽进行条件化。我们通过实验证明,NU-Wave 2 无论输入采样率如何都能产生高分辨率音频,且所需参数量少于其他模型。官方代码和音频样本可在 https://mindslab-ai.github.io/nuwave2 获取。

关键词

引用

@article{arxiv.2206.08545,
  title  = {NU-Wave 2: A General Neural Audio Upsampling Model for Various Sampling Rates},
  author = {Seungu Han and Junhyeok Lee},
  journal= {arXiv preprint arXiv:2206.08545},
  year   = {2022}
}

备注

Accepted to Interspeech 2022