中文

WaveCRN:一种用于端到端语音增强的高效卷积循环神经网络

音频与语音处理 2021-02-03 v3 机器学习 声音 机器学习

摘要

由于简洁的设计流程,用于语音增强(SE)的端到端(E2E)神经模型引起了极大兴趣。为提升 E2E 模型的性能,在建模时应高效考量语音的局部性与时间序列特性。然而,在当前大多数 SE 的 E2E 模型中,这些特性要么未被充分考虑,要么过于复杂而难以实现。本文提出一种高效的 E2E SE 模型,称为 WaveCRN。在 WaveCRN 中,语音局部特征由卷积神经网络(CNN)捕获,而该局部特征的时间序列特性由堆叠的简单循环单元(SRU)建模。与使用难以并行化的长短期记忆(LSTM)网络的常规时间序列模型不同,SRU 可在计算中高效并行化,且模型参数更少。此外,为更有效地抑制输入含噪语音中的噪声成分,我们推导出一种新颖的受限特征掩蔽(RFM)方法,其在隐藏层特征图上进行增强;这不同于语音分离方法中常用的对含噪谱特征施加估计比率掩码的做法。在语音去噪与压缩语音恢复任务上的实验结果证实,借助 SRU 的轻量架构与基于特征映射的 RFM,WaveCRN 以显著降低的模型复杂度与推理时间,取得了与其他最先进方法相当的性能。

关键词

引用

@article{arxiv.2004.04098,
  title  = {WaveCRN: An Efficient Convolutional Recurrent Neural Network for End-to-end Speech Enhancement},
  author = {Tsun-An Hsieh and Hsin-Min Wang and Xugang Lu and Yu Tsao},
  journal= {arXiv preprint arXiv:2004.04098},
  year   = {2021}
}