基于深度滤波器组均衡器的低延迟单通道语音增强
音频与语音处理
2022-06-01 v1 声音
信号处理
摘要
对于许多应用(如数字助听器、声学透明助听设备和公共广播系统),语音增强算法在保持低延迟的同时取得良好性能是非常可取的。为改进传统低延迟语音增强算法的性能,提出了一种深度滤波器组均衡器(FBE)框架,其将基于深度学习的子带降噪网络与基于深度学习的缩短数字滤波器映射网络相集成。在第一个网络中,训练深度学习模型时采用可控的小帧移以满足低延迟需求,即 4 ms,从而获得(复)子带增益,其可视为每帧中的自适应数字滤波器。在第二个网络中,为降低延迟,通过该基于深度学习的框架隐式地缩短此自适应数字滤波器,随后将其应用于带噪语音以重建增强语音,且无需重叠相加方法。在 WSJ0-SI84 语料库上的实验结果表明,所提出的仅 4 ms 延迟的深度 FBE 在 PESQ、STOI 和降噪量等指标上均显著优于传统低延迟语音增强算法。
引用
@article{arxiv.2202.06764,
title = {Low-latency Monaural Speech Enhancement with Deep Filter-bank Equalizer},
author = {Chengshi Zheng and Wenzhe Liu and Andong Li and Yuxuan Ke and Xiaodong Li},
journal= {arXiv preprint arXiv:2202.06764},
year = {2022}
}
备注
35 pages, 8 figures