基于循环谱波束成形与 DNN 的低 SNR 场景语音增强的两步方法
音频与语音处理
2026-02-16 v1 声音
摘要
深度神经网络(DNN)在低信噪比(SNR)场景下常难以抑制噪声。本文针对以谐波噪声为主导的语音增强场景,提出一种集成循环谱波束成形与轻量级 DNN 降噪的框架。作为预处理模块,采用循环最小功率失配响应(cMPDR)谱波束成形器,利用循环谱相关性抑制谐波成分,无需修改 DNN 架构。对该管线在单通道场景下的评估采用两种 DNN 架构:一种是简单轻量级的卷积循环神经网络(CRNN),另一种是最先进的超低复杂度网络(ULCNet)。在合成数据与实地录制的旋转机械噪声主导的真实场景中进行实验,结果显示与端到端 DNN 基线相比,本方法在低 SNR 条件下持续提升。值得注意的是,采用 cMPDR 预处理的高效 CRNN 参数量小,却超越了在原始输入或韦恩滤波后输入上的更大规模 ULCNet。这些结果表明,显式地将循环谱性质作为信号先验纳入模型,比单纯增加模型容量更有效地抑制谐波干扰。
引用
@article{arxiv.2602.12986,
title = {A two-step approach for speech enhancement in low-SNR scenarios using cyclostationary beamforming and DNNs},
author = {Giovanni Bologni and Nicolás Arrieta Larraza and Richard Heusdens and Richard C. Hendriks},
journal= {arXiv preprint arXiv:2602.12986},
year = {2026}
}
备注
Submitted version