面向实时语音降噪的可微时变IIR滤波
声音
2026-03-04 v1 人工智能
机器学习
音频与语音处理
摘要
我们提出TVF(Time-Varying Filtering),一个具有100万参数的低延迟语音增强模型。将数字信号处理(DSP)的可解释性与深度学习的适应性相结合,TVF弥合了传统滤波与现代神经语音建模之间的差距。该模型利用轻量级神经网络主干网络实时预测35带IIR滤波级联的系数,使其能够动态适应非平稳噪声。与“黑箱”深度学习方法不同,TVF提供了完全可解释的处理链,其中谱修饰是显式且可调的。我们在语音降噪任务上使用Valentini-Botinhao数据集演示了该方法的有效性,并将结果与静态DDSP方法和完全基于深度学习的解决方案进行比较,表明TVF能够有效适应变化的噪声条件。
引用
@article{arxiv.2603.02794,
title = {Differentiable Time-Varying IIR Filtering for Real-Time Speech Denoising},
author = {Riccardo Rota and Kiril Ratmanski and Jozef Coldenhoff and Milos Cernak},
journal= {arXiv preprint arXiv:2603.02794},
year = {2026}
}
备注
Submitted to Interspeech 2026