具有极低算法延迟的 STFT 域神经语音增强
声音
2022-12-07 v3 音频与语音处理
摘要
基于深度学习的短时傅里叶变换(STFT)域语音增强通常使用较大的窗长,如 32 ms。较大的窗可带来更高的频率分辨率并可能获得更好的增强效果。然而这在在线设置中会导致 32 ms 的算法延迟,因为逆 STFT(iSTFT)中使用的重叠相加算法也采用相同窗长。为降低这种固有延迟,我们将传统的双窗长方法(STFT 使用常规输入窗长,而重叠相加使用较短输出窗)应用于 STFT 域基于深度学习的帧在线语音增强。基于该 STFT-iSTFT 配置,我们采用复数谱映射进行帧在线增强,训练深度神经网络(DNN)从混合信号的实部和虚部(RI)分量预测目标语音的 RI 分量。此外,我们利用 DNN 预测的 RI 分量进行帧在线波束成形,其结果作为额外特征输入第二个 DNN 进行帧在线后滤波。该频域波束成形器可轻松与我们的 DNN 集成,且设计上不引入任何算法延迟。另外,我们提出一种未来帧预测技术以进一步降低算法延迟。在噪声混响语音增强上的评估显示了所提算法的有效性。与 Conv-TasNet 相比,我们的 STFT 域系统在相当计算量下可实现更好的增强性能,或在更少计算量下达到相当性能,并在低至 2 ms 的算法延迟下保持强劲性能。
引用
@article{arxiv.2204.09911,
title = {STFT-Domain Neural Speech Enhancement with Very Low Algorithmic Latency},
author = {Zhong-Qiu Wang and Gordon Wichern and Shinji Watanabe and Jonathan Le Roux},
journal= {arXiv preprint arXiv:2204.09911},
year = {2022}
}
备注
in IEEE/ACM Transactions on Audio, Speech, and Language Processing