中文

面向沖納语语言的深度学习自动语音识别模型

计算与语言 2025-07-30 v1 声音 音频与语音处理

摘要

本研究提出了基于深度学习的自动语音识别系统,用于沖納语(Shona),这是一种语言独特声调和语法复杂、资源有限的语言。研究旨在解决由于训练数据有限、缺乏标注数据以及沖納语语音中复杂声调细微差别所带来的挑战,并旨在实现对比传统统计模型的显著识别准确率提升。首先,研究探讨了使用深度学习开发沖納语精准 ASR 系统的可行性。其次,研究考察了在沖納语语音识别中设计和实现深度学习架构的具体挑战,并提出了缓解这些挑战的策略。最后,将深度学习模型与现有统计模型在准确率方面进行比较。开发的 ASR 系统采用混合架构,包含用于声学建模的卷积神经网络和用于语言建模的长短期记忆网络。为克服数据稀缺问题,采用了数据增强技术和迁移学习。还采纳了注意力机制以适应沖納语的声调特性。所得 ASR 系统取得了令人印象深刻的成绩,词错误率为 29%,音素错误率为 12%,总体准确率为 74%。这些指标表明深度学习有潜力提高资源受限语言(如沖納语)的 ASR 识别准确率。本研究推动了面向资源受限语言(如沖納语)的 ASR 技术发展,最终促进了沖納语使用者全球范围内的可达性和沟通。

关键词

引用

@article{arxiv.2507.21331,
  title  = {A Deep Learning Automatic Speech Recognition Model for Shona Language},
  author = {Leslie Wellington Sirora and Mainford Mutandavari},
  journal= {arXiv preprint arXiv:2507.21331},
  year   = {2025}
}