中文

基于超条件可微双二阶滤波器的轻量可解释音频失真效果神经建模

音频与语音处理 2021-03-17 v1 声音 信号处理

摘要

在本工作中,我们提出使用可微级联双二阶滤波器来建模音频失真效果。我们将可训练无限冲激响应(IIR)滤波器扩展到超条件情形,其中学习一个变换,将失真效果的外部参数直接映射至其内部的滤波器与增益参数,以及确保滤波器稳定性所需的激活函数。我们提出了一种通过傅里叶变换实现 IIR 滤波器的高效训练方案。相较于使用有限冲激响应滤波器的更传统的黑盒神经音频效果建模方法,我们的模型参数量显著更少且复杂度更低。我们最小且性能最佳的模型以总计 40 个双二阶滤波器和仅 210 个参数,在 44.1 kHz 下充分建模了 BOSS MT-2 踏板。其模型参数具有可解释性,可关联回原始模拟音频电路,甚至可在模型训练后由机器学习非专家直观修改。定量与定性结果说明了所提方法的有效性。

关键词

引用

@article{arxiv.2103.08709,
  title  = {Lightweight and interpretable neural modeling of an audio distortion effect using hyperconditioned differentiable biquads},
  author = {Shahan Nercessian and Andy Sarroff and Kurt James Werner},
  journal= {arXiv preprint arXiv:2103.08709},
  year   = {2021}
}

备注

5 pages, 4 figures. To be published in IEEE International Conference on Acoustics, Speech, & Signal Processing (ICASSP) 2021