中文

Svarah:在印度口音上评估英语自动语音识别系统

计算与语言 2023-05-26 v1 声音 音频与语音处理

摘要

印度是世界上第二大英语使用国,拥有约1.3亿使用者。因此,面向英语的自动语音识别(ASR)系统必须在印度口音上进行评估。遗憾的是,在现有的英语ASR基准(如LibriSpeech、Switchboard、Speech Accent Archive等)中,印度说话人的代表性非常不足。在这项工作中,我们通过创建Svarah来弥补这一差距,该基准包含来自印度各地65个地理位置的117名说话人的9.6小时转写英语音频,产生了多样化的口音。Svarah包含朗读语音和自发对话数据,涵盖历史、文化、旅游等多个领域,确保了词汇的多样性。我们在Svarah上评估了6个开源ASR模型和2个商业ASR系统,结果表明在印度口音上仍有明显的改进空间。Svarah以及我们的所有代码将公开可用。

关键词

引用

@article{arxiv.2305.15760,
  title  = {Svarah: Evaluating English ASR Systems on Indian Accents},
  author = {Tahir Javed and Sakshi Joshi and Vignesh Nagarajan and Sai Sundaresan and Janki Nawale and Abhigyan Raman and Kaushal Bhogale and Pratyush Kumar and Mitesh M. Khapra},
  journal= {arXiv preprint arXiv:2305.15760},
  year   = {2023}
}