面向尼日利亚皮钦语自动语音识别的端到端训练探索
音频与语音处理
2025-05-27 v2 人工智能
计算与语言
机器学习
声音
摘要
近年来,自动语音识别(ASR)系统在口语应用中的普及程度显著提升。值得注意的是,许多非洲语言缺乏足够的语言资源来支撑这些系统的鲁棒性。本文聚焦于为尼日利亚皮钦英语定制开发端到端语音识别系统。我们在一个新数据集上调研并评估了不同的预训练最先进架构。我们的实证结果表明,变体 Wav2Vec2 XLSR-53 在我们的数据集上表现优异,在测试集上取得了 29.6% 的词错误率(WER),在定量评估中超越了 NEMO QUARTZNET 和 Wav2Vec2.0 BASE-100H 等其他架构。此外,我们证明预训练的最先进架构并非开箱即用。我们使用 XLSR-English 作为基线进行零样本评估,因其与尼日利亚皮钦语相似而选之。这产生了 73.7% 的较高 WER。通过将此架构适配到我们数据集中所体现的细微特征,我们将错误率降低了 59.84%。我们的数据集包含来自 10 位母语者的 4,288 条录音语句,划分为训练、验证和测试集。本研究凸显了为尼日利亚皮钦英语等低资源语言改进 ASR 系统的潜力,有助于在语音技术应用中实现更大的包容性。我们在 Hugging Face 上公开发布了我们独特的尼日利亚皮钦语并行数据集(语音到文本)以及模型权重。我们的代码将公开以促进社区的后续研究。
引用
@article{arxiv.2010.11123,
title = {Towards End-to-End Training of Automatic Speech Recognition for Nigerian Pidgin},
author = {Amina Mardiyyah Rufai and Afolabi Abeeb and Esther Oduntan and Tayo Arulogun and Oluwabukola Adegboro and Daniel Ajisafe},
journal= {arXiv preprint arXiv:2010.11123},
year = {2025}
}
备注
Updated empirical results, included additional architectures, and added a zero-shot baseline