利用真实训练数据进行深度噪声抑制
音频与语音处理
2023-09-06 v1 声音
摘要
大多数深度噪声抑制(DNS)模型使用基于参考的损失进行训练,需要获取干净语音。然而,有时加性麦克风模型对于真实世界应用而言是不够的。因此,在DNS模型的有监督学习中利用真实训练数据的方法有望减少潜在的训练/推理失配。利用真实数据进行DNS训练要么需要生成式方法,要么需要无需对应干净语音的无参考损失。在本工作中,我们提出采用一个名为PESQ-DNN的端到端非侵入式深度神经网络(DNN)来估计增强后真实数据的语音质量感知评估(PESQ)分数。它为DNS训练期间利用真实数据提供了一种无参考感知损失,以最大化PESQ分数。此外,我们采用一种按轮次交替的训练协议,先在真实数据上更新DNS模型,随后在合成数据上更新PESQ-DNN。利用PESQ-DNN并采用真实数据训练的DNS模型优于所有仅使用合成训练数据的参考方法。在合成测试数据上,我们提出的方法比Interspeech 2021 DNS挑战赛基线显著高出0.32个PESQ点。在合成和真实测试数据上,所提方法均比基线高出0.05个DNSMOS点——尽管PESQ-DNN优化的是不同的感知指标。
引用
@article{arxiv.2309.02432,
title = {Employing Real Training Data for Deep Noise Suppression},
author = {Ziyi Xu and Marvin Sach and Jan Pirklbauer and Tim Fingscheidt},
journal= {arXiv preprint arXiv:2309.02432},
year = {2023}
}