参数化神经音频效果中的质量与泛化性探究
音频与语音处理
2020-06-11 v1 机器学习
声音
摘要
深度神经网络在音乐音频信号处理应用中已展现出潜力,常超越先前方法,尤其是作为波形域中的端到端模型。然而迄今为止的结果往往受限于低采样率、噪声、狭窄的信号类型域和/或缺乏参数化控制(即“旋钮”),使其对专业音频工程工作流的适用性仍然不足。本工作在先前关于利用深度神经网络建模与音乐制作相关的非线性时变信号处理效果的研究基础上进行了扩展,该网络能够模拟你在模拟设备上会看到的参数化设置,目标是最终产生商业上可行的高质量音频,即44.1 kHz采样率、16位分辨率。本文结果突出了通过架构和优化改动在建模这些效果方面的进展,旨在提高计算效率、降低信噪比,并扩展到更多种类的非线性音频效果。为此,所采用的策略为三管齐下:模型速度、模型精度和模型泛化性。除数据集操作外,所提出的大多数方法相较原始模型在输出精度上仅有微小提升或无提升。我们发现,限制数据集的音频内容,例如仅使用单一乐器的数据集,相比在更通用数据集上训练的模型显著提升了模型精度。
引用
@article{arxiv.2006.05584,
title = {Exploring Quality and Generalizability in Parameterized Neural Audio Effects},
author = {William Mitchell and Scott H. Hawley},
journal= {arXiv preprint arXiv:2006.05584},
year = {2020}
}
备注
7 pages, 5 figures