中文

AfriSpeech-200:面向临床与通用领域 ASR 的泛非口音语音数据集

计算与语言 2023-10-03 v1

摘要

非洲的医患比例极低。在非常繁忙的诊所中,医生每天可能要看 30 多名患者——与发达国家相比,这是沉重的患者负担——但这些过度劳累的临床医生缺乏诸如临床自动语音识别(ASR)之类的生产力工具。然而,临床 ASR 在发达国家已经成熟,甚至无处不在,临床医生对商业临床 ASR 系统的报告性能总体令人满意。此外,近期通用领域 ASR 的性能正接近人类准确率。然而,仍存在若干差距。多篇出版物强调了语音转文本算法中的种族偏见,且其在少数族裔口音上的性能显著落后。据我们所知,目前尚无公开可用的关于带口音的非洲临床 ASR 的研究或基准,且对于大多数非洲口音而言语音数据并不存在。我们发布了 AfriSpeech,即 200 小时的泛非英语语音,包含来自 13 个国家、120 种本土口音的 2463 名独特说话人的 67577 条音频片段,用于临床与通用领域 ASR,以及一个基准测试集,并公开提供在 AfriSpeech 基准上达到 SOTA 性能的预训练模型。

关键词

引用

@article{arxiv.2310.00274,
  title  = {AfriSpeech-200: Pan-African Accented Speech Dataset for Clinical and General Domain ASR},
  author = {Tobi Olatunji and Tejumade Afonja and Aditya Yadavalli and Chris Chinenye Emezue and Sahib Singh and Bonaventure F. P. Dossou and Joanne Osuchukwu and Salomey Osei and Atnafu Lambebo Tonja and Naome Etori and Clinton Mbataku},
  journal= {arXiv preprint arXiv:2310.00274},
  year   = {2023}
}

备注

Accepted to TACL 2023. This is a pre-MIT Press publication version