中文

深度卷积Maxout神经网络在语音识别中的性能评估

音频与语音处理 2021-05-06 v1 声音

摘要

本文中,为连续波斯语语音识别之目的,将对深度人工神经网络(DNN)的各种结构与方法进行评估与比较。最早用于语音识别应用的神经网络模型之一是全连接神经网络(FCNN),以及随之而来的深度神经网络(DNN)。尽管这些模型相较GMM/HMM模型具有更优性能,但它们不具备对局部语音信息建模的恰当结构。卷积神经网络(CNN)是建模包括语音信号在内的生物信号局部结构的良好选择。深度人工神经网络面临的另一问题是网络在训练数据上的收敛。收敛的主要阻碍是训练过程中局部极小值的存在。深度神经网络预训练方法尽管计算量大,却是跨越局部极小值的强力工具。但在网络结构中使用恰当的神经元模型似乎是更好的解决方案。修正线性单元神经元模型与Maxout模型是迄今提出的最合适神经元模型。我们进行了若干实验以评估上述方法与结构的性能。在验证这些方法的良好运作后,将所有模型组合应用于FARSDAT语音数据库进行连续语音识别。实验所得结果表明,组合模型(CMDNN)相较使用sigmoid神经元的预训练全连接NN,将ANN在语音识别中的性能提升了约3%。

关键词

引用

@article{arxiv.2105.01399,
  title  = {Performance Evaluation of Deep Convolutional Maxout Neural Network in Speech Recognition},
  author = {Arash Dehghani and Seyyed Ali Seyyedsalehi},
  journal= {arXiv preprint arXiv:2105.01399},
  year   = {2021}
}

备注

6 pages, 2 figures, conference paper submitted to 2018 25th National and 3rd International Iranian Conference on Biomedical Engineering (ICBME)