中文

基于非因果深度学习的去混响

音频与语音处理 2020-09-08 v1 声音

摘要

本文中,我们证明了非因果上下文在基于深度学习的自动语音识别(ASR)系统中减轻混响影响的有效性。首先,通过使用非因果 FIR 滤波器比较先前与未来信息的贡献,展示了非因果上下文的价值。其次,训练了基于 MLP 和 LSTM 的去混响网络,以确认在利用干净语音训练的 ASR 系统中使用因果与非因果上下文的效果。在 REVERB 挑战赛的干净训练实验中,基于非因果深度学习的去混响相比流行的加权预测误差(WPE)方法实现了 45% 的词错误率(WER)相对降低。最后,提出了一种扩展的多条件训练流程,结合基于混响与去混响信号组合生成的半增强测试语句,以减少非因果去混响方法可能引入的任何伪影或失真。与不含和含 WPE 的最新 REVERB 挑战赛基准系统相比,两种方法的结合分别提供了平均 10.9% 和 6.0% 的 WER 相对降低。

关键词

引用

@article{arxiv.2009.02832,
  title  = {Non causal deep learning based dereverberation},
  author = {Jorge Wuth and Richard M. Stern and Nestor Becerra Yoma},
  journal= {arXiv preprint arXiv:2009.02832},
  year   = {2020}
}

备注

33 pages