中文

基于混合CNN-BiGRU模型的健壮波斯数字识别:面向噪声环境

声音 2025-02-12 v2 计算机视觉与模式识别 音频与语音处理

摘要

人工智能已显著推进了语音识别应用,但许多现有基于神经网络的方法在面对噪声时会降低准确率,难以在真实环境中实现良好表现。本研究针对零语音波斯数字识别(0至9),尤其关注在噪声环境下的识别,特别是针对发音相似的数字。提出一种结合残差卷积神经网络和双向门控循环单元(BiGRU)的混合模型,采用词单元而非音素单元进行speaker-independent识别。对FARSDIGIT1数据集进行数据增强处理,并使用Mel频率倒谱系数(MFCC)进行特征提取。实验结果表明,该模型效果显著,分别在训练、验证和测试集上达到98.53%、96.10%和95.92%的准确率。在噪声环境下,所提方法相较于基于音素单元的LSTM模型提高了26.88%的识别准确率,相较于基于Mel尺度二维根倒谱系数(MTDRCC)特征提取技术和多层感知器(MLP)模型(MTDRCC+MLP)提高了7.61%的准确率。

关键词

引用

@article{arxiv.2412.10857,
  title  = {Robust Persian Digit Recognition in Noisy Environments Using Hybrid CNN-BiGRU Model},
  author = {Ali Nasr-Esfahani and Mehdi Bekrani and Roozbeh Rajabi},
  journal= {arXiv preprint arXiv:2412.10857},
  year   = {2025}
}

备注

6 pages, two columns, submitted to Pattern Recognition Letters