LAHAJA:用于评估印地语自动语音识别系统的鲁棒多口音基准测试
计算与语言
2024-08-22 v1
摘要
印地语是印度使用最广泛的语言之一,由于使用者的语言来源多样,呈现出多种口音。为了实现对印地语自动语音识别系统在多种口音下的鲁棒评估,我们创建了基准测试 LAHAJA,其中包含涵盖多种主题和用例的朗读和即兴演讲语音,共计 12.5 小时的印地语音频,来自 132 位说话人,覆盖印度 83 个地区。我们在 LAHAJA 上评估了现有的开源和商业模型,发现它们的性能较差。然后我们使用不同的数据集训练模型,发现我们在具有良好说话人多样性的多语种数据上训练的模型显著优于现有模型。我们还进行了细粒度分析,结果表明来自印度东北部和南部的说话人性能下降,尤其是在包含大量命名实体和专业术语的内容上。
引用
@article{arxiv.2408.11440,
title = {LAHAJA: A Robust Multi-accent Benchmark for Evaluating Hindi ASR Systems},
author = {Tahir Javed and Janki Nawale and Sakshi Joshi and Eldho George and Kaushal Bhogale and Deovrat Mehendale and Mitesh M. Khapra},
journal= {arXiv preprint arXiv:2408.11440},
year = {2024}
}