面向低资源语言中受损语音数据收集的社区驱动 Cookbook
计算与语言
2025-07-04 v1
摘要
本研究提出一种用于收集语音样本以构建受损语音自动语音识别(ASR)模型的方法,尤其针对低资源语言。旨在通过开发社区驱动的数据收集与 ASR 模型构建的最佳实践指南和培训, democratize ASR 技术。作为概念验证,本研究精选了首个公开的 Akan 语言中受损语音数据集:Akan 是加纳广泛使用的本土语言。该研究涉及来自不同背景、具备语音损伤的受试者。所得数据集、Cookbook 及开源工具均公开可用,以便研究人员和实践者创建针对语音受损个体特殊需求的包容性 ASR 技术。此外,本研究呈现了微调开源 ASR 模型以更好地识别 Akan 语言中受损语音的初始结果。
引用
@article{arxiv.2507.02428,
title = {A Cookbook for Community-driven Data Collection of Impaired Speech in LowResource Languages},
author = {Sumaya Ahmed Salihs and Isaac Wiafe and Jamal-Deen Abdulai and Elikem Doe Atsakpo and Gifty Ayoka and Richard Cave and Akon Obu Ekpezu and Catherine Holloway and Katrin Tomanek and Fiifi Baffoe Payin Winful},
journal= {arXiv preprint arXiv:2507.02428},
year = {2025}
}
备注
This version has been reviewed and accepted for presentation at the InterSpeech 2025 conference to be held in Rotterdam from 17 to 21 August. 5 pages and 3 tables