基于非因果深度学习的去混响
音频与语音处理
2020-09-08 v1 声音
摘要
本文中,我们证明了非因果上下文在基于深度学习的自动语音识别(ASR)系统中减轻混响影响的有效性。首先,通过使用非因果 FIR 滤波器比较先前与未来信息的贡献,展示了非因果上下文的价值。其次,训练了基于 MLP 和 LSTM 的去混响网络,以确认在利用干净语音训练的 ASR 系统中使用因果与非因果上下文的效果。在 REVERB 挑战赛的干净训练实验中,基于非因果深度学习的去混响相比流行的加权预测误差(WPE)方法实现了 45% 的词错误率(WER)相对降低。最后,提出了一种扩展的多条件训练流程,结合基于混响与去混响信号组合生成的半增强测试语句,以减少非因果去混响方法可能引入的任何伪影或失真。与不含和含 WPE 的最新 REVERB 挑战赛基准系统相比,两种方法的结合分别提供了平均 10.9% 和 6.0% 的 WER 相对降低。
引用
@article{arxiv.2009.02832,
title = {Non causal deep learning based dereverberation},
author = {Jorge Wuth and Richard M. Stern and Nestor Becerra Yoma},
journal= {arXiv preprint arXiv:2009.02832},
year = {2020}
}
备注
33 pages