基于深度卷积Maxout神经网络的波斯语语音识别时频定位
声音
2022-09-01 v4 人工智能
音频与语音处理
摘要
本文提出一种基于CNN的时频信息定位结构用于波斯语语音识别。研究表明,哺乳动物初级听觉皮层和脑干中某些神经元的感受野的频谱-时间可塑性使得定位功能可改善识别性能。过去几年中,利用HMM、TDNN、CNN和LSTM-RNN等方法的空间或时间不变性特性,已在ASR系统中做了大量时频信息定位工作。然而,这些模型大多参数量大且难以训练。为此,我们提出一种称为时频卷积Maxout神经网络(TFCMNN)的结构,其中并行的时间域和频率域一维CMNN同时且独立地应用于谱图,然后将它们的输出拼接并共同应用于全连接Maxout网络进行分类。为提升该结构性能,我们采用了Dropout、maxout和权重归一化等新方法与新模型。在FARSDAT数据集上设计并实施了两组实验,以评估该模型相对于传统一维CMNN模型的性能。实验结果表明,TFCMNN模型的平均识别得分比传统一维CMNN模型的平均得分高约1.6%。此外,TFCMNN模型的平均训练时间比传统模型的平均训练时间少约17小时。因此,正如其他文献所证实的,ASR系统中的时频定位提高了系统准确率并加速了训练过程。
引用
@article{arxiv.2108.03818,
title = {Time-Frequency Localization Using Deep Convolutional Maxout Neural Network in Persian Speech Recognition},
author = {Arash Dehghani and Seyyed Ali Seyyedsalehi},
journal= {arXiv preprint arXiv:2108.03818},
year = {2022}
}