中文

基于门控循环融合与联合训练框架的鲁棒端到端语音识别

声音 2020-11-10 v1 计算与语言 音频与语音处理

摘要

语音增强与识别方法的联合训练框架在鲁棒端到端自动语音识别(ASR)中已取得相当好的性能。然而,这些方法仅将增强特征作为语音识别组件的输入,受到语音失真问题的影响。为解决该问题,本文提出一种带联合训练框架的门控循环融合(GRF)方法用于鲁棒端到端 ASR。GRF 算法用于动态结合带噪特征与增强特征。因此,GRF 不仅能从增强特征中去除噪声信号,还能从带噪特征中学习原始精细结构,从而缓解语音失真。所提方法由语音增强、GRF 与语音识别组成。首先,基于掩码的语音增强网络用于增强输入语音。其次,应用 GRF 解决语音失真问题。第三,为提升 ASR 性能,采用最先进的 speech transformer 算法作为语音识别组件。最后,利用联合训练框架同时优化这三个组件。我们的实验在名为 AISHELL-1 的开源普通话语音语料库上进行。实验结果表明,相较于仅使用增强特征的传统联合增强与 transformer 方法,所提方法实现了 10.04% 的相对字符错误率(CER)降低。特别是在低信噪比(0 dB)下,我们的方法取得了更好性能, CER 降低 12.67%,这表明了所提方法的潜力。

关键词

引用

@article{arxiv.2011.04249,
  title  = {Gated Recurrent Fusion with Joint Training Framework for Robust End-to-End Speech Recognition},
  author = {Cunhang Fan and Jiangyan Yi and Jianhua Tao and Zhengkun Tian and Bin Liu and Zhengqi Wen},
  journal= {arXiv preprint arXiv:2011.04249},
  year   = {2020}
}

备注

Accepted by IEEE/ACM Transactions on Audio, Speech, and Language Processing