基于卷积神经网络的孟加拉语语音数字识别方法
声音
2021-11-15 v1 人工智能
计算与语言
机器学习
摘要
语音识别是一种将人类语音信号转换为文本或单词或任何计算机及其他机器易于理解形式的技术。已有少数关于孟加拉语数字识别系统的研究,其中大多数使用在性别、年龄、方言及其他变量上变化很少的小数据集。本研究使用不同性别、年龄和方言的孟加拉国人的音频录音,创建了一个大型的'0-9'孟加拉语口语数字语音数据集。此处,每个数字记录了 400 个含噪与无噪样本以创建数据集。梅尔频率倒谱系数(MFCC)已被用于从原始语音数据中提取有意义特征。随后,为检测孟加拉语数字,使用了卷积神经网络(CNN)。所提技术在整个数据集上以 97.1% 的准确率识别'0-9'孟加拉语口语数字。该模型的效率也通过 10 折交叉验证评估,获得了 96.7% 的准确率。
引用
@article{arxiv.2111.06625,
title = {A Convolutional Neural Network Based Approach to Recognize Bangla Spoken Digits from Speech Signal},
author = {Ovishake Sen and Al-Mahmud and Pias Roy},
journal= {arXiv preprint arXiv:2111.06625},
year = {2021}
}
备注
4 pages, 5 figures, 2021 International Conference on Electronics, Communications and Information Technology (ICECIT), 14 to 16 September 2021, Khulna, Bangladesh