中文

面向远距离语音识别的自动上下文窗组合

音频与语音处理 2018-05-29 v1 机器学习 神经与进化计算 声音

摘要

远距离语音识别正被深度学习所革新,后者显著优于以往的 HMM-GMM 系统。DNN 迅速崛起并成功的一个关键方面是其更好地处理大时间上下文的能力。就此而言,嵌入比未来帧更多过去帧的非对称上下文窗近来已用于前馈神经网络。这种上下文配置不仅有助于实现低延迟语音识别,还能在混响条件下提升识别性能。本文研究 DNN 内部导致非对称上下文有效应用的机制。特别地,我们提出一种基于梯度分析的自动上下文窗组合新方法。在不同声学环境、特征、DNN 架构、麦克风设置与识别任务上进行的实验表明,这种简单而高效的策略带来了冗余更少的帧配置,使 DNN 训练在混响场景中更为有效。

关键词

引用

@article{arxiv.1805.10498,
  title  = {Automatic context window composition for distant speech recognition},
  author = {Mirco Ravanelli and Maurizio Omologo},
  journal= {arXiv preprint arXiv:1805.10498},
  year   = {2018}
}

备注

This is a preprint version of the paper published on Speech Communication Journal, 2018. Please see https://www.sciencedirect.com/science/article/pii/S0167639318300128 for the published version of this article