Svarah:在印度口音上评估英语自动语音识别系统
计算与语言
2023-05-26 v1 声音
音频与语音处理
摘要
印度是世界上第二大英语使用国,拥有约1.3亿使用者。因此,面向英语的自动语音识别(ASR)系统必须在印度口音上进行评估。遗憾的是,在现有的英语ASR基准(如LibriSpeech、Switchboard、Speech Accent Archive等)中,印度说话人的代表性非常不足。在这项工作中,我们通过创建Svarah来弥补这一差距,该基准包含来自印度各地65个地理位置的117名说话人的9.6小时转写英语音频,产生了多样化的口音。Svarah包含朗读语音和自发对话数据,涵盖历史、文化、旅游等多个领域,确保了词汇的多样性。我们在Svarah上评估了6个开源ASR模型和2个商业ASR系统,结果表明在印度口音上仍有明显的改进空间。Svarah以及我们的所有代码将公开可用。
引用
@article{arxiv.2305.15760,
title = {Svarah: Evaluating English ASR Systems on Indian Accents},
author = {Tahir Javed and Sakshi Joshi and Vignesh Nagarajan and Sai Sundaresan and Janki Nawale and Abhigyan Raman and Kaushal Bhogale and Pratyush Kumar and Mitesh M. Khapra},
journal= {arXiv preprint arXiv:2305.15760},
year = {2023}
}