在达里语语音识别中应用混合深度神经网络
音频与语音处理
2023-05-08 v1 计算与语言
声音
摘要
本文是我们先前会议论文的扩展。近年来,研究者对开发和改进语音识别系统以促进并增强人机交互的兴趣与日俱增。如今,自动语音识别(ASR)系统已无处不在,从游戏到翻译系统、机器人等诸多领域均有应用。然而,针对低资源语言的语音识别系统仍需大量研究。本文聚焦于利用梅尔频率倒谱系数(MFCCs)特征提取方法,以及三种不同的深度神经网络模型——卷积神经网络(CNN)、循环神经网络(RNN)和多层感知机(MLP),还有两种结合 CNN 与 RNN 的混合模型,来识别达里语中的孤立词。我们使用自建的达里语孤立词语料库对这些模型进行评估,该语料库包含 20 个达里语短词的 1000 条语音。我们的研究取得了 98.365% 的惊人平均准确率。
引用
@article{arxiv.2305.03200,
title = {Employing Hybrid Deep Neural Networks on Dari Speech},
author = {Jawid Ahmad Baktash and Mursal Dawodi},
journal= {arXiv preprint arXiv:2305.03200},
year = {2023}
}
备注
https://nlpai2023.org/papers?fbclid=IwAR2v29d3nFUaIx9U-rnfN8pqJu1tXBS9P9OV1IJnsbJ0QHN9JZAMPhZA7Ds