中文

基于 CNN、双向 LSTM 和 ResNet 的尼泊尔语言自动语音识别

计算与语言 2024-06-27 v1 声音 音频与语音处理

摘要

本文提出了一种用于将尼泊尔语语音转化为文本的端到端深度学习自动语音识别 (ASR) 模型。该模型在 OpenSLR (音频、文本) 数据集上进行训练和测试。大多数音频数据集在两端都有静默间隙,这些间隙在数据预处理期间被裁剪,以实现语音帧及其对应文本之间的更均匀映射。采用 Mel 频率倒谱系数 (MFCCs) 作为音频特征输入模型。该模型采用双向 LSTM 与 ResNet 和一维 CNN 的组合,在所有已训练的模型(包括使用 LSTM、GRU、CNN 和 ResNet 变体的神经网络)中效果最佳。该新模型在训练期间使用 Connectionist Temporal Classification (CTC) 函数进行损失计算,并使用 CTC 束搜索解码器预测尼泊尔文本的最可能字符序列。在测试数据集上,实现了 17.06% 的字符错误率 (CER)。源代码可在 https://github.com/manishdhakal/ASR-Nepali-using-CNN-BiLSTM-ResNet 查阅。

关键词

引用

@article{arxiv.2406.17825,
  title  = {Automatic speech recognition for the Nepali language using CNN, bidirectional LSTM and ResNet},
  author = {Manish Dhakal and Arman Chhetri and Aman Kumar Gupta and Prabin Lamichhane and Suraj Pandey and Subarna Shakya},
  journal= {arXiv preprint arXiv:2406.17825},
  year   = {2024}
}

备注

Accepted at 2022 International Conference on Inventive Computation Technologies (ICICT), IEEE