中文

通过双路径 RNN 提升 DeepFilterNet2:DPDFNet

声音 2026-01-14 v2

摘要

我们提出 DPDFNet,一种因果单通道语音增强模型,通过在编码器中引入双路径块来扩展 DeepFilterNet2 架构,强化长程时序和跨带建模,同时保持原始增强框架。此外,我们展示了通过添加缓解增强语音过度衰减的损失组件,结合针对“随时可用”应用的微调阶段,能在整体模型性能上实现显著提升。为比较我们提出的架构与各种因果开源模型,我们创建了一个新的评估集,包含跨 12 种语言的长时段、低信噪比录音,覆盖日常噪声情景,更贴近实际应用条件。 在此评估集上,DPDFNet 在其他因果开源模型中表现优异,包括一些规模更大、计算更密集的模型。我们还提出了一种整体指标 PRISM,即基于可侵入和非侵入指标的、规模归一化的综合指标,显示其与双路径模块数量的明显可扩展性。我们进一步在 Ceva-NeuPro-Nano 边缘 NPU 上实现了设备部署。结果表明,DPDFNet-4(我们第二个最大的模型)在 NPN32 上实现实时性能,并在 NPN64 上运行更快,证明了在严格的嵌入式功耗和延迟约束下,能够维持最先进的质量。

关键词

引用

@article{arxiv.2512.16420,
  title  = {DPDFNet: Boosting DeepFilterNet2 via Dual-Path RNN},
  author = {Daniel Rika and Nino Sapir and Ido Gus},
  journal= {arXiv preprint arXiv:2512.16420},
  year   = {2026}
}