中文

用于自动语音识别的孟加拉语 Common Voice 语音数据集

计算与语言 2022-06-30 v2 声音 音频与语音处理

摘要

孟加拉语是全球使用人数最多的语言之一,全球使用者超过 3 亿。尽管其流行度很高,但由于缺乏多样化的开源数据集,孟加拉语语音识别系统的研究开发受到阻碍。为此,我们众包了孟加拉语 Common Voice 语音数据集,这是一个句子级的自动语音识别语料库。该数据集采集于 Mozilla Common Voice 平台,是一项持续进行的活动的一部分,已在 2 个月内收集超过 400 小时数据且仍在快速增长。我们的分析表明,与现有最大的开源孟加拉语语音数据集 OpenSLR Bengali ASR 数据集相比,该数据集在说话人、音素和环境多样性上更优。我们展示了从该数据集中获得的见解,并讨论了未来版本中需要解决的关键语言挑战。此外,我们报告了当前几种自动语音识别(ASR)算法的性能,并为未来研究设定了基准。

关键词

引用

@article{arxiv.2206.14053,
  title  = {Bengali Common Voice Speech Dataset for Automatic Speech Recognition},
  author = {Samiul Alam and Asif Sushmit and Zaowad Abdullah and Shahrin Nakkhatra and MD. Nazmuddoha Ansary and Syed Mobassir Hossen and Sazia Morshed Mehnaz and Tahsin Reasat and Ahmed Imtiaz Humayun},
  journal= {arXiv preprint arXiv:2206.14053},
  year   = {2022}
}