使用平衡循环神经网络的实时语音增强
音频与语音处理
2020-02-17 v1 声音
摘要
我们提出了一种用于实时应用的因果深度神经网络(DNN)语音增强方法。DNN已被广泛用于估计时频(T-F)掩码以增强语音信号。其中一种流行的DNN结构是因能有效建模语音等时间序列数据而著称的循环神经网络(RNN)。特别地,长短期记忆(LSTM)常被用来缓解使RNN训练困难的梯度消失/爆炸问题。然而,LSTM的参数数量因缓解训练困难而增加,这需要更多的计算资源。对于实时语音增强,最好使用更小的网络而不损失性能。在本文中,我们提出使用平衡循环神经网络(ERNN)来避免梯度消失/爆炸问题,且不增加参数数量。所提出的结构是因果的,仅需要来自过去的信息,以便应用于实时场景。与单向和双向LSTM网络相比,所提出的方法以少得多的参数实现了相似的性能。
引用
@article{arxiv.2002.05843,
title = {Real-time speech enhancement using equilibriated RNN},
author = {Daiki Takeuchi and Kohei Yatabe and Yuma Koizumi and Yasuhiro Oikawa and Noboru Harada},
journal= {arXiv preprint arXiv:2002.05843},
year = {2020}
}
备注
To appear in Proc. IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP 2020)