Bangla-Wave:利用N-gram语言模型改进孟加拉语自动语音识别
计算与语言
2022-09-27 v1 人工智能
音频与语音处理
摘要
尽管全球有超过3亿人使用孟加拉语,但由于孟加拉语是一种低资源语言,在改进孟加拉语语音转文本转录方面所做的工作甚少。然而,随着孟加拉语Common Voice 9.0语音数据集的引入,自动语音识别(ASR)模型现在可以显著改进。拥有399小时语音录音的Bengali Common Voice是世界上最大且最多样化的开源孟加拉语语音语料库。在本文中,我们通过在common voice数据集上微调预训练的wav2vec2模型,超越了SOTA预训练孟加拉语ASR模型。我们还展示了如何通过添加n-gram语言模型作为后处理器来显著提升ASR模型的性能。最后,我们进行了一些实验和超参数调优,以生成一个优于现有ASR模型的鲁棒孟加拉语ASR模型。
引用
@article{arxiv.2209.12650,
title = {Bangla-Wave: Improving Bangla Automatic Speech Recognition Utilizing N-gram Language Models},
author = {Mohammed Rakib and Md. Ismail Hossain and Nabeel Mohammed and Fuad Rahman},
journal= {arXiv preprint arXiv:2209.12650},
year = {2022}
}