中文

Bangla-Wave:利用N-gram语言模型改进孟加拉语自动语音识别

计算与语言 2022-09-27 v1 人工智能 音频与语音处理

摘要

尽管全球有超过3亿人使用孟加拉语,但由于孟加拉语是一种低资源语言,在改进孟加拉语语音转文本转录方面所做的工作甚少。然而,随着孟加拉语Common Voice 9.0语音数据集的引入,自动语音识别(ASR)模型现在可以显著改进。拥有399小时语音录音的Bengali Common Voice是世界上最大且最多样化的开源孟加拉语语音语料库。在本文中,我们通过在common voice数据集上微调预训练的wav2vec2模型,超越了SOTA预训练孟加拉语ASR模型。我们还展示了如何通过添加n-gram语言模型作为后处理器来显著提升ASR模型的性能。最后,我们进行了一些实验和超参数调优,以生成一个优于现有ASR模型的鲁棒孟加拉语ASR模型。

关键词

引用

@article{arxiv.2209.12650,
  title  = {Bangla-Wave: Improving Bangla Automatic Speech Recognition Utilizing N-gram Language Models},
  author = {Mohammed Rakib and Md. Ismail Hossain and Nabeel Mohammed and Fuad Rahman},
  journal= {arXiv preprint arXiv:2209.12650},
  year   = {2022}
}