基于循环两阶段网络的相位感知语音增强
音频与语音处理
2020-01-28 v1
摘要
我们提出一种基于神经网络的语音增强(SE)方法,称为相位感知循环两阶段网络(rTSN)。rTSN 是我们先前提出的两阶段网络(TSN)框架的扩展。该 TSN 框架配备了一种提升策略(BS),其先从先验神经网络(pri-NN)初步估计多个基预测(MBP),再由后验神经网络(post-NN)聚合这些 MBP 以获得最终预测。TSN 优于多种 SOTA 方法;然而,它采用简单的深度神经网络作为 pri-NN。我们发现 pri-NN 比 post-NN 更影响性能(在感知质量上);因此我们采用长短期记忆循环神经网络(LSTM-RNN)作为 pri-NN,以增强语音信号内上下文信息的使用。此外,TSN 框架未考虑相位重建,尽管相位信息影响感知质量。因此,我们提出采用基于 Griffin-Lim 算法的相位重建方法。最后,我们在感知质量相关指标以及音素识别错误率上,将 rTSN 与 TSN 等基线进行了评估。
引用
@article{arxiv.2001.09772,
title = {Phase-Aware Speech Enhancement with a Recurrent Two Stage Net work},
author = {Juntae Kim and Jaesung Bae},
journal= {arXiv preprint arXiv:2001.09772},
year = {2020}
}