基于生成对抗网络的原始音频带宽扩展
声音
2019-03-22 v1 音频与语音处理
摘要
基于神经网络的方法近期在图像合成与超分辨率任务上展示了最先进的结果,特别是通过使用带有监督特征损失的生成对抗网络(GAN)变体。然而,以往的特征损失公式依赖于大型辅助分类器网络以及能够训练此类分类器的带标签数据集的可用性。此外,探索基于GAN的方法在图像与视频以外领域的适用性相关工作相对较少。在本文中,我们探索了一种基于GAN的音频处理方法,并开发了卷积神经网络架构以执行音频超分辨率。除若干用于音频处理的新架构构建模块外,我们方法的一个关键组成部分是使用基于自编码器的损失,其使得在GAN框架下利用源自无标签数据的特征损失进行训练成为可能。我们探究了架构选择的影响,并在客观与感知质量方面展示了相较以往工作的显著提升。
引用
@article{arxiv.1903.09027,
title = {Bandwidth Extension on Raw Audio via Generative Adversarial Networks},
author = {Sung Kim and Visvesh Sathe},
journal= {arXiv preprint arXiv:1903.09027},
year = {2019}
}