基于深度神经网络通过最大化短时客观可懂度度量实现单通道语音增强
声音
2018-02-05 v1 音频与语音处理
摘要
在本文中,我们提出了一种基于深度神经网络(DNN)的语音增强(SE)系统,其设计目标是最大化短时客观可懂度(STOI)度量的一个近似。我们形式化了一个近似STOI代价函数,并推导了DNN训练所需梯度的解析表达式,表明这些梯度与基于梯度的优化技术结合使用时具有理想的性质。我们通过仿真实验表明,所提出的SE系统在多种信噪比下,针对匹配与不匹配的自然噪声类型进行测试时,在估计语音可懂度方面取得了大幅提升。此外,我们表明,使用近似STOI代价函数训练的SE系统,其性能与在短时时间包络上应用均方误差代价函数训练的系统相当。最后,我们表明所提出的SE系统在估计语音可懂度方面与传统基于DNN的短时谱幅度(STSA)SE系统性能相当。这些结果十分重要,因为它们表明传统的基于DNN的STSA SE系统在估计语音可懂度方面可能是最优的。
引用
@article{arxiv.1802.00604,
title = {Monaural Speech Enhancement using Deep Neural Networks by Maximizing a Short-Time Objective Intelligibility Measure},
author = {Morten Kolbæk and Zheng-Hua Tan and Jesper Jensen},
journal= {arXiv preprint arXiv:1802.00604},
year = {2018}
}
备注
To appear in ICASSP 2018