中文

面向实时语音降噪的可微时变IIR滤波

声音 2026-03-04 v1 人工智能 机器学习 音频与语音处理

摘要

我们提出TVF(Time-Varying Filtering),一个具有100万参数的低延迟语音增强模型。将数字信号处理(DSP)的可解释性与深度学习的适应性相结合,TVF弥合了传统滤波与现代神经语音建模之间的差距。该模型利用轻量级神经网络主干网络实时预测35带IIR滤波级联的系数,使其能够动态适应非平稳噪声。与“黑箱”深度学习方法不同,TVF提供了完全可解释的处理链,其中谱修饰是显式且可调的。我们在语音降噪任务上使用Valentini-Botinhao数据集演示了该方法的有效性,并将结果与静态DDSP方法和完全基于深度学习的解决方案进行比较,表明TVF能够有效适应变化的噪声条件。

关键词

引用

@article{arxiv.2603.02794,
  title  = {Differentiable Time-Varying IIR Filtering for Real-Time Speech Denoising},
  author = {Riccardo Rota and Kiril Ratmanski and Jozef Coldenhoff and Milos Cernak},
  journal= {arXiv preprint arXiv:2603.02794},
  year   = {2026}
}

备注

Submitted to Interspeech 2026