中文

基于卷积循环神经网络渐进学习的单通道语音增强

声音 2020-01-14 v3 音频与语音处理

摘要

近来,渐进学习已显示出其在结合深度神经网络(DNN)和长短期记忆(LSTM)基单通道语音增强算法时改善语音质量与语音可懂度的能力,尤其在低信噪比(SNR)条件下。然而,由于参数量大且计算复杂度高,其难以在现有资源受限的微控制器中实现,因此对于实际应用而言,大幅减少参数量和计算负载至关重要。为此,我们提出了一种基于因果卷积循环神经网络的新型渐进学习框架,称为 PL-CRNN,它利用卷积神经网络与循环神经网络两者的优势,大幅减少参数量并同时改善语音质量与语音可懂度。大量实验验证了所提 PL-CRNN 模型的有效性,并表明其在客观度量上相比 PL-DNN 和 PL-LSTM 算法取得了一致更优的性能,且获得了接近甚至优于 CRNN 的结果。与 PL-DNN、PL-LSTM 和 CRNN 相比,所提 PL-CRNN 算法可分别减少多达 93%、97% 和 92% 的参数量。

关键词

引用

@article{arxiv.1908.10768,
  title  = {Convolutional Recurrent Neural Network Based Progressive Learning for Monaural Speech Enhancement},
  author = {Andong Li and Minmin Yuan and Chengshi Zheng and Xiaodong Li},
  journal= {arXiv preprint arXiv:1908.10768},
  year   = {2020}
}

备注

23 pages,5 figures, Submitted to Applied Acoustics