神经音频合成中的上采样伪影
声音
2021-02-10 v2 机器学习
音频与语音处理
摘要
近期神经音频合成的若干进展依赖于上采样层,而这会引入不期望的伪影。在计算机视觉中,上采样伪影已被研究并被称为棋盘伪影(因其特征性的视觉图案)。然而,其在音频处理中的影响迄今被忽视。在此,我们从音频信号处理的角度研究该问题以弥补这一空白。我们首先表明上采样伪影的主要来源为:(i) 有问题的上采样算子引入的音调与滤波伪影,以及 (ii) 上采样时出现的频谱副本。随后我们比较了不同的上采样层,表明最近邻上采样器可作为易引入音调伪影的有问题(但属当前最优)的转置卷积与子像素卷积的替代方案。
引用
@article{arxiv.2010.14356,
title = {Upsampling artifacts in neural audio synthesis},
author = {Jordi Pons and Santiago Pascual and Giulio Cengarle and Joan Serrà},
journal= {arXiv preprint arXiv:2010.14356},
year = {2021}
}
备注
In proceedings of ICASSP2021. Code: https://github.com/DolbyLaboratories/neural-upsampling-artifacts-audio