从稀缺到规模:帕施托语 Common Voice 数据集的发布层面分析
计算与语言
2026-02-17 v1 声音
摘要
大型公开许可语音数据集是构建自动语音识别 (ASR) 系统的必备资源,但许多广泛使用语言在公共资源中仍显不足。帕施托语(Pashto)拥有超过 6000 万使用者,长期缺乏适用于现代 ASR 开发的大规模公开许可语音数据。本文对帕施托语 Mozilla Common Voice 语料库的 24.0 版本(2025 年 12 月)进行发布层面分析,并梳理主要版本间的发展趋势。我们记录了从 2023 年中期的 1.49 小时录制时长增长至 2025 年的 2768.7 小时,其中 975.89 小时经过验证,可用于监督式 ASR 训练。除规模外,我们还分析了验证吞吐量、贡献者参与不平等、人口学元数据完整性以及经验证子集中的句子级集中度。我们发现参与度极度集中(Gini = 0.941),年龄表示严重偏向年轻成年人,41.97% 的音频片段缺乏自报告性别标签,限制了基于元数据的子群审计。就文本层面而言,提示词重复程度适中:35.88% 的唯一句子占经验证片段总数的 50%,表明结构性集中主要由参与者活动不均所致,而非小范围提示词主导。这些结果对快速扩张的低资源语音语料库进行定量审计,揭示了提升数据集成熟度的实际优先事项,包括扩大验证容量和更广泛的人口学参与。
引用
@article{arxiv.2602.14062,
title = {From Scarcity to Scale: A Release-Level Analysis of the Pashto Common Voice Dataset},
author = {Jandad Jahani and Mursal Dawodi and Jawid Ahmad Baktash},
journal= {arXiv preprint arXiv:2602.14062},
year = {2026}
}