真实世界嘈杂环境下语音增强深度学习模型比较评估
声音
2026-01-22 v2 机器学习
音频与语音处理
摘要
语音增强,特别是去噪,是改善语音信号在真实世界应用中 intelligibility 和质量的关键,尤其是在嘈杂环境中。虽然先前的研究引入了各种深度学习模型,但许多模型在噪声抑制、感知质量和说话人特征保留之间难以实现平衡,留下了在实际表现评估中比较其权衡的关键研究空白。本研究在诸如 SpEAR、VPQAD 和 Clarkson 数据集等多样化数据集上,对三个最先进的模型 Wave-U-Net、CMGAN 和 U-Net 进行基准测试。这些模型之所以被选择,是因为它们在文献中具有相关性且代码可访问。评估结果表明,U-Net 在 SpEAR 上实现 +71.96% 的信噪比提升,在 VPQAD 上实现 +64.83% 的提升,在 Clarkson 数据集上实现 +364.2% 的提升。CMGAN 在感知质量方面表现突出,分别在 SpEAR 和 VPQAD 上取得最高的 PESQ 分数 4.04 和 1.46,适合注重自然和可理解性的应用。Wave-U-Net 在这些属性之间取得平衡,证明其在说话人特征保留方面具有优势,分别在 SpEAR 和 VPQAD 上实现了 VeriSpeak 分数的 +10.84% 和 +27.38% 的提升。该研究表明,先进的方法可用于优化噪声抑制、感知质量和说话人识别之间的权衡。这些发现可能为语音生物识别、Forensic 音频分析、通信和说话人验证在具有挑战性声学条件下的应用做出贡献。
引用
@article{arxiv.2506.15000,
title = {A Comparative Evaluation of Deep Learning Models for Speech Enhancement in Real-World Noisy Environments},
author = {Md Jahangir Alam Khondkar and Ajan Ahmed and Stephanie Schuckers and Masudul Haider Imtiaz},
journal= {arXiv preprint arXiv:2506.15000},
year = {2026}
}