中文

基于卷积神经网络的 Hindi 语关键词检测

声音 2026-05-06 v1 人工智能

摘要

本研究探讨了在印地语语音识别领域应用关键词检测(KWS),利用由 40,000 个音频样本组成的数据集。该数据集的采样率为 44 kHz,平均时长为 1.9 秒。我们专注于开发针对用户特定查询的高效设备内 KWS 系统。利用卷积神经网络(CNN)进行分类,我们采用特征工程技术将原始音频记录转换为梅尔频率倒谱系数(MFCC),作为网络的输入。我们的实验涵盖 various CNN 架构,探索其在持续语流中识别预定义关键词的有效性。我们的 CNN 基于方法通过严格评估实现了令人钦佩的 91.79% 准确率,展示了在印地语语音识别中具有前景的性能,同时确保计算效率和用户特定定制。

关键词

引用

@article{arxiv.2605.02928,
  title  = {Keyword spotting using convolutional neural network for speech recognition in Hindi},
  author = {Saru Bharti and Pushparaj Mani Pathak},
  journal= {arXiv preprint arXiv:2605.02928},
  year   = {2026}
}

备注

Published in 2024 15th International Conference on Computing Communication and Networking Technologies (ICCCNT)