多率神经音频效处理的重抽取滤波器设计
音频与语音处理
2025-05-28 v2 机器学习
声音
信号处理
摘要
神经网络在音频效应建模中已变得无处不在,尤其是对于吉他放大器和失真踏板。这种模型的一个局限是,其训练数据的采样率在模型权重中被隐式编码,因此在推断时难以调整。最近的工作探索了修改递归神经网络(RNN)架构以近似 sample rate independent 系统的做法,使音频处理能够以不同于原始训练速率的速率进行处理。该方法对于 integer oversampling 效果良好,可减少由 nonlinear 激活函数引起的混叠。对于 small fractional 改变的采样率,可以使用 fractional delay 滤波器来近似 sample rate independence,但在某些情况下,这种方法会完全失败。本文探索了在神经网络的输入和输出处进行 real-time signal 重抽样作为一种替代方案。我们研究了各种重抽取滤波器设计,表明由 half-band IIR 滤波器级联 Kaiser window FIR 滤波器组成的 two-stage 设计可以获得与之前提出的 model adjustment 方法相似或更好的结果,该方法每样本的滤波操作数更少,在典型音频速率下延迟不到1毫秒。此外,我们研究了用于 integer oversampling 的 interpolation 和 decimation 滤波器,表明级联的 half-band IIR 和 FIR 设计可以与 model adjustment 方法结合使用,以减少 various失真效应模型中的混叠。
引用
@article{arxiv.2501.18470,
title = {Resampling Filter Design for Multirate Neural Audio Effect Processing},
author = {Alistair Carson and Vesa Välimäki and Alec Wright and Stefan Bilbao},
journal= {arXiv preprint arXiv:2501.18470},
year = {2025}
}
备注
Accepted for publication in IEEE Transactions on Audio, Speech and Language Processing