基于深度学习的时间包络去混响用于鲁棒语音识别
音频与语音处理
2020-08-11 v1 声音
信号处理
摘要
在混响条件下进行自动语音识别是一项具有挑战性的任务,因为混响语音的长时包络在时间上发生了模糊。本文中,我们提出了一种用于子带时间包络增强以进行语音去混响的神经模型。时间包络是利用频域线性预测(FDLP)的自回归建模框架导出的。本文提出的神经增强模型对时间包络执行基于包络增益的增强,其由一系列卷积与循环神经网络层组成。增强后的子带包络用于生成自动语音识别(ASR)的特征。ASR 实验在 REVERB challenge 数据集以及 CHiME-3 数据集上进行。在这些实验中,所提出的神经增强方法相比使用波束成形音频的基线 ASR 系统提供了显著改进(在 REVERB challenge 数据集上,开发集词错误率平均相对改进 21%,评估集约 11%)。
引用
@article{arxiv.2008.03339,
title = {Deep Learning Based Dereverberation of Temporal Envelopesfor Robust Speech Recognition},
author = {Anurenjan Purushothaman and Anirudh Sreeram and Rohit Kumar and Sriram Ganapathy},
journal= {arXiv preprint arXiv:2008.03339},
year = {2020}
}