English

Robust Persian Digit Recognition in Noisy Environments Using Hybrid CNN-BiGRU Model

Sound 2025-02-12 v2 Computer Vision and Pattern Recognition Audio and Speech Processing

Abstract

Artificial intelligence (AI) has significantly advanced speech recognition applications. However, many existing neural network-based methods struggle with noise, reducing accuracy in real-world environments. This study addresses isolated spoken Persian digit recognition (zero to nine) under noisy conditions, particularly for phonetically similar numbers. A hybrid model combining residual convolutional neural networks and bidirectional gated recurrent units (BiGRU) is proposed, utilizing word units instead of phoneme units for speaker-independent recognition. The FARSDIGIT1 dataset, augmented with various approaches, is processed using Mel-Frequency Cepstral Coefficients (MFCC) for feature extraction. Experimental results demonstrate the model's effectiveness, achieving 98.53%, 96.10%, and 95.92% accuracy on training, validation, and test sets, respectively. In noisy conditions, the proposed approach improves recognition by 26.88% over phoneme unit-based LSTM models and surpasses the Mel-scale Two Dimension Root Cepstrum Coefficients (MTDRCC) feature extraction technique along with MLP model (MTDRCC+MLP) by 7.61%.

Keywords

Cite

@article{arxiv.2412.10857,
  title  = {Robust Persian Digit Recognition in Noisy Environments Using Hybrid CNN-BiGRU Model},
  author = {Ali Nasr-Esfahani and Mehdi Bekrani and Roozbeh Rajabi},
  journal= {arXiv preprint arXiv:2412.10857},
  year   = {2025}
}

Comments

6 pages, two columns, submitted to Pattern Recognition Letters

R2 v1 2026-06-28T20:35:18.468Z