AfriSpeech-MultiBench:面向非洲英语口音的垂直化多域多国家基准套件
计算与语言
2025-11-19 v1
摘要
语音化AI技术的快速发展,如谷歌的NotebookLM和OpenAI的语音到语音API,正在推动全球语音界面技术的普及。尽管如此,目前尚无公开可用的面向非洲语言多样性的特定应用模型评估方案。我们提出AfriSpeech-MultiBench,首个面向100多个非洲英语口音(覆盖10+国家,7个应用领域:金融、法律、医疗、一般对话、呼叫中心、专有名实体与幻觉鲁棒性)的领域特定评估套件。我们对标 diverse range 的开源、闭源、单模态ASR和多模态LLM语音识别系统,采用来自多个公开非洲英语口音语料库的自发及非自发对话进行评估。我们的实证分析揭示系统性差异:开源ASR模型在自发语境下表现优异,但在噪声非母语对话中性能下降;多模态LLM更具口音鲁棒性,但在领域特定专有名实体方面仍有挑战;专有模型在干净语音上准确率高,但因国家和领域差异而表现差异显著。面向非洲英语的模型微调可实现与低延迟相当的竞争准确率,实际部署优势显著;尽管如此,SOTA模型仍面临幻觉问题严重。通过发布这一全面基准,我们赋能实践者和研究者选择适用于非洲场景的语音技术,推动包容性语音应用服务于资源受限社区。
引用
@article{arxiv.2511.14255,
title = {AfriSpeech-MultiBench: A Verticalized Multidomain Multicountry Benchmark Suite for African Accented English ASR},
author = {Gabrial Zencha Ashungafac and Mardhiyah Sanni and Busayo Awobade and Alex Gichamba and Tobi Olatunji},
journal= {arXiv preprint arXiv:2511.14255},
year = {2025}
}
备注
Accepted As a Conference Paper IJCNLP-AACL 2025