音频超分辨率中预上采样生成建模与生成对抗网络的研究
音频与语音处理
2021-10-01 v1 声音
摘要
已有若干成功的深度学习模型用于音频超分辨率。其中许多方法涉及使用预处理特征提取,这需要大量特定领域的信号处理知识来实现。卷积神经网络(CNNs)通过自动学习滤波器改进了此框架。卷积方法的一个例子是 AudioUNet,其灵感来自图像上采样的新方法。我们的论文将预上采样的 AudioUNet 与一种新的生成模型进行比较,该模型在上采样信号之后使用深度学习将其转化为更可信的信号。基于用于图像超分辨率的 EDSR 网络,新提出的模型以对数谱距离提升 20%、平均意见得分 4.06(相较两倍上采样情形下的 3.82)优于 UNet。AudioEDSR 的参数也比 AudioUNet 少 87%。本文还探讨了将 AudioUNet 纳入 Wasserstein GAN(带梯度惩罚)(WGAN-GP) 结构对训练的影响。最后分析了伪影对当前最优方法的影响,并提出了解决该问题的方案。本文所用方法在电话语音、音频识别与音频生成任务中具有广泛应用。
引用
@article{arxiv.2109.14994,
title = {An investigation of pre-upsampling generative modelling and Generative Adversarial Networks in audio super resolution},
author = {James King and Ramon Viñas Torné and Alexander Campbell and Pietro Liò},
journal= {arXiv preprint arXiv:2109.14994},
year = {2021}
}