中文

跨域特定数据集的阿干语语音识别模型基准测试:性能、可扩展性与适应性的比较评估

计算与语言 2025-07-04 v1 机器学习 声音 音频与语音处理

摘要

大多数现有自动语音识别 (ASR) 研究在 in-domain 数据集上进行评估。然而,他们很少评估模型如何在 diverse speech contexts 中泛化。本研究通过使用 four Akan speech corpora 对七个基于 transformer 架构构建的 Akan ASR 模型进行基准测试(如 Whisper 和 Wav2Vec2),以确定其 performance。这些数据集涵盖 various domains,包括与文化相关的图像描述、非正式对话、圣经经文朗读以及自发的金融对话。word error rate 和 character error rate 的比较突显了 domain dependency,模型仅在其 training 域内表现最佳,而在不匹配情景中显示出显著的 accuracy 下降。本研究还识别了 Whisper 和 Wav2Vec2 架构之间的 distinct error behaviors。虽然 fine-tuned Whisper Akan 模型导致更流畅但可能产生误导性的转录错误,但 Wav2Vec2 在遇到陌生输入时产生更明显但不够可解释的输出。这种在 ASR 错误中的 readability 与 transparency 之间的 trade-off 应该在为 low-resource language (LRL) 应用程序选择架构时考虑。这些发现突显了针对 Akan 及其他 LRL 需要 targeted domain adaptation techniques、adaptive routing strategies 和 multilingual training frameworks 的必要性。

关键词

引用

@article{arxiv.2507.02407,
  title  = {Benchmarking Akan ASR Models Across Domain-Specific Datasets: A Comparative Evaluation of Performance, Scalability, and Adaptability},
  author = {Mark Atta Mensah and Isaac Wiafe and Akon Ekpezu and Justice Kwame Appati and Jamal-Deen Abdulai and Akosua Nyarkoa Wiafe-Akenten and Frank Ernest Yeboah and Gifty Odame},
  journal= {arXiv preprint arXiv:2507.02407},
  year   = {2025}
}

备注

This version has been reviewed and accepted for presentation at the Future Technologies Conference (FTC) 2025, to be held on 6 & 7 November 2025 in Munich, Germany. 17 pages, 4 figures, 1 table