基于掩码的语音增强中神经网络的成分损失
音频与语音处理
2019-08-15 v1 声音
摘要
近年来,使用深度学习方法估计单通道语音增强的时频域掩码已成为一个热门研究领域并取得了有前景的结果。本文中,我们提出一种新颖的成分损失(CL)用于训练基于掩码的语音增强神经网络。在训练过程中,所提出的 CL 对语音成分质量的保持、残余噪声成分的抑制,以及自然听感残余噪声成分的保持提供独立控制。我们通过评估一个用于基于掩码语音增强的标准卷积神经网络(CNN)来说明所提出 CL 的潜力。新的 CL 在几乎所有采用的客观质量指标上均比基线损失取得更好且更均衡的性能,后者包括常规的均方误差(MSE)损失以及与听觉相关的损失函数,如语音质量感知评估(PESQ)损失和近期提出的感知加权滤波器损失。特别地,应用 CL 提供了更好的语音成分质量、更好的整体增强语音感知质量,以及更自然的残余噪声听感。平均而言,对于已见噪声类型,增强语音的 PESQ 分数至少提高 0.1 分,同时 SNR 提升超过 0.5 dB。对于未见噪声类型,该改进更显著,增强语音的 PESQ 分数提高约 0.2 分,同时输出 SNR 领先超过 0.5 dB。新提出的 CL 易于实现,代码见 https://github.com/ifnspaml/Components-Loss。
引用
@article{arxiv.1908.05087,
title = {Components Loss for Neural Networks in Mask-Based Speech Enhancement},
author = {Ziyi Xu and Samy Elshamy and Ziyue Zhao and Tim Fingscheidt},
journal= {arXiv preprint arXiv:1908.05087},
year = {2019}
}