中文

Vistaar:面向印度语言ASR的多样化基准与训练集

计算与语言 2023-08-03 v2 声音 音频与语音处理

摘要

改进ASR系统对于让基于LLM的新用例惠及全球人群十分必要。本文聚焦印度语言,并论证需要多样化基准来评估和改进印度语言的ASR系统。为此,我们整理出Vistaar作为一组跨越多种语言与领域组合的59个基准,并在其上评估了3个公开可用的ASR系统与2个商业系统。我们还通过在12种印度语言上总计10.7K小时的公开可用训练数据集微调Whisper模型,训练了IndicWhisper模型。我们展示IndicWhisper在Vistaar基准上相较所考虑的ASR系统显著改进。事实上,IndicWhisper在59个基准中的39个上取得了最低WER,平均降低4.1 WER。我们开源了所有数据集、代码与模型。

关键词

引用

@article{arxiv.2305.15386,
  title  = {Vistaar: Diverse Benchmarks and Training Sets for Indian Language ASR},
  author = {Kaushal Santosh Bhogale and Sai Sundaresan and Abhigyan Raman and Tahir Javed and Mitesh M. Khapra and Pratyush Kumar},
  journal= {arXiv preprint arXiv:2305.15386},
  year   = {2023}
}

备注

Accepted in INTERSPEECH 2023