中文

推进非洲口音语音识别:基于认知不确定性的数据选择用于可泛化 ASR 模型

计算与语言 2025-06-24 v7 声音 音频与语音处理

摘要

口音在塑造人类交流中起着关键作用,增强了我们以清晰和文化细微差别传达与理解信息的能力。尽管自动语音识别(ASR)已取得显著进展,非洲口音英语 ASR 因缺乏训练数据集而研究不足,此类数据集的创建通常成本高昂且需要大量人力。结合多种主动学习范式与核心集(core-set)方法,我们提出一种利用认知不确定性自动化标注过程的新多轮自适应流程,显著降低了相关成本与人力。该新颖方法简化了数据标注,并策略性地选取对模型不确定性贡献最大的数据样本,提升了训练效率。我们定义了一种新的 U-WER 指标来追踪模型对口音困难样本的适配情况。我们在多个领域、数据集与高性能语音模型上评估了我们的方法。结果表明,与既定基线相比,我们的方法在平均少用 45% 数据的情况下实现了 27% 的 WER 相对平均提升。我们的方法还改善了极低资源口音的分布外泛化能力,证明了其在非洲口音 ASR 背景下构建可泛化 ASR 模型的可行性。我们在此开源代码:https://github.com/bonaventuredossou/active_learning_african_asr。

关键词

引用

@article{arxiv.2306.02105,
  title  = {Advancing African-Accented Speech Recognition: Epistemic Uncertainty-Driven Data Selection for Generalizable ASR Models},
  author = {Bonaventure F. P. Dossou},
  journal= {arXiv preprint arXiv:2306.02105},
  year   = {2025}
}

备注

Accepted at ACL SRW 2025