语音增强中短时客观可懂度与短时谱幅度均方误差之间的关系
声音
2018-12-05 v2 音频与语音处理
摘要
大多数基于深度神经网络(DNN)的语音增强算法依赖于短时谱幅度(STSA)的均方误差(MSE)准则,该准则与人类感知(如语音可懂度)没有明显联系。另一方面,短时客观可懂度(STOI)作为一种流行的先进语音可懂度估计器,依赖于语音时间包络的线性相关性。这就提出了一个问题:与基于STSA-MSE准则的算法相比,基于包络线性相关性(ELC)的DNN训练准则能否带来更好的基于DNN的语音增强算法的语音可懂度性能。本文推导得出,在某些一般条件下,STSA-MSE与ELC准则实际上是等价的,并且我们提供了经验数据来支持我们的理论结果。此外,我们的实验结果表明,如果目标是以相对于STOI语音可懂度估计器最优的方式增强含噪语音,那么标准STSA最小MSE估计器是接近最优的。
引用
@article{arxiv.1806.08404,
title = {On the Relationship Between Short-Time Objective Intelligibility and Short-Time Spectral-Amplitude Mean-Square Error for Speech Enhancement},
author = {Morten Kolbæk and Zheng-Hua Tan and Jesper Jensen},
journal= {arXiv preprint arXiv:1806.08404},
year = {2018}
}