中文

WSRGlow:一种基于 Glow 的音频超分辨率波形生成模型

声音 2021-06-17 v1 音频与语音处理

摘要

音频超分辨率是从低分辨率(LR)音频通过补充缺失频带构建高分辨率(HR)音频的任务。先前基于卷积神经网络和均方误差训练目标的方法性能相对较低,而对抗生成模型难以训练和调参。近来,标准化流因其高性能、训练简单和推理快速而备受关注。本文提出 WSRGlow,一种基于 Glow 的波形生成模型用于音频超分辨率。具体而言,1)我们整合 WaveNet 与 Glow,直接最大化以 LR 信息为条件的目标 HR 音频的精确似然;2)为利用低分辨率音频中的音频信息,我们提出一个 LR 音频编码器与一个 STFT 编码器,分别从时域和频域编码 LR 信息。实验结果表明,所提模型更易训练,且在客观与感知质量上均优于先前工作。WSRGlow 也是首个从 12kHz LR 音频生成 48kHz 波形的模型。

关键词

引用

@article{arxiv.2106.08507,
  title  = {WSRGlow: A Glow-based Waveform Generative Model for Audio Super-Resolution},
  author = {Kexun Zhang and Yi Ren and Changliang Xu and Zhou Zhao},
  journal= {arXiv preprint arXiv:2106.08507},
  year   = {2021}
}

备注

Accepted by INTERSPEECH 2021